DeepSeek V3.1 : raisonnement hybride, architecture et évolution

Guide indépendant : deepseek-fr.ai n’est ni le site officiel de DeepSeek ni affilié à l’entreprise. Cette fiche s’appuie uniquement sur les annonces, dépôts et documents techniques publiés par DeepSeek. Dernière vérification factuelle : 20 juillet 2026.

DeepSeek V3.1 en bref

Réponse rapide : DeepSeek-V3.1 est un modèle historique à poids ouverts publié le 21 août 2025. Il a introduit, dans un même checkpoint, un mode de réponse directe Non-Think et un mode de raisonnement Think, avec 128K tokens de contexte et des capacités agentiques renforcées. Il n’est plus servi par l’API officielle de DeepSeek. Il reste pertinent pour la recherche, la reproduction d’anciens tests et l’auto-hébergement sur une infrastructure adaptée ; pour une nouvelle intégration à l’API DeepSeek, utilisez les modèles V4 actuellement documentés.

ÉlémentInformation vérifiée
Publication21 août 2025
Statut actuelVersion historique ; absente de l’API officielle actuelle
ArchitectureMixture-of-Experts, famille DeepSeek-V3
Paramètres671B pour le modèle principal, 37B activés par token
Taille complète des poids685B avec le module Multi-Token Prediction de 14B
Contexte128K tokens
ModesThink et Non-Think
PoidsV3.1 et V3.1-Base publiés par DeepSeek
LicenceMIT pour le dépôt et les poids publiés
Successeur immédiatDeepSeek-V3.1-Terminus, publié le 22 septembre 2025

Qu’est-ce que DeepSeek-V3.1 ?

DeepSeek-V3.1 appartient à la lignée V3 et conserve son architecture Mixture-of-Experts : le modèle possède une grande capacité totale, mais n’active qu’une partie de ses paramètres pour chaque token. DeepSeek indique 671 milliards de paramètres dans le modèle principal et 37 milliards activés par token. Les fichiers distribués représentent 685 milliards de paramètres au total, car ils incluent également un module Multi-Token Prediction de 14 milliards de paramètres.

La version V3.1-Base a poursuivi le pré-entraînement de V3 sur environ 840 milliards de tokens afin d’étendre le long contexte. La fiche officielle détaille deux phases : 630 milliards de tokens pour l’extension à 32K, puis 209 milliards pour l’extension à 128K. Le modèle conversationnel V3.1 a ensuite été post-entraîné au-dessus de cette base.

Son apport le plus visible est le raisonnement hybride. Au lieu de publier un modèle généraliste et un autre réservé au raisonnement, DeepSeek a fait fonctionner les deux comportements dans le même checkpoint en modifiant le chat template. Cette conception a servi d’étape importante vers les générations V3.2 puis V4.

Think et Non-Think : deux comportements, pas deux modèles

ModeÀ privilégier pourPoint de vigilance
Non-ThinkRésumé, extraction, reformulation, réponses rapides et tool calling standardMoins adapté aux problèmes nécessitant plusieurs étapes de raisonnement
ThinkMathématiques, débogage, planification et recherche complexePeut générer davantage de tokens et augmenter la latence

Dans les poids V3.1, le mode dépend du template envoyé au modèle. Le tool calling standard est documenté en Non-Think. DeepSeek fournit aussi un format spécifique de Search Agent pour faire appel à un outil de recherche en mode Think. Cette distinction est importante : le simple fait de changer un paramètre générique dans un serveur tiers ne garantit pas que le template V3.1 correct sera appliqué.

Lors de la sortie, les identifiants API deepseek-chat et deepseek-reasoner correspondaient respectivement aux modes Non-Think et Think de V3.1. Ces noms n’étaient pas des versions figées : DeepSeek les a réaffectés à des modèles ultérieurs. Ils ne permettent donc pas de demander V3.1 aujourd’hui. DeepSeek a annoncé leur retrait définitif le 24 juillet 2026 à 15 h 59 UTC.

DeepSeek V3.1 et V3.1-Terminus : quelle différence ?

DeepSeek-V3.1-Terminus n’est ni un surnom ni un mode supplémentaire de V3.1. C’est un checkpoint mis à jour le 22 septembre 2025. DeepSeek l’a présenté comme une correction de V3.1 fondée sur les retours des utilisateurs.

  • V3.1 : première version hybride du 21 août 2025.
  • V3.1-Terminus : mise à jour du 22 septembre 2025, avec moins de mélanges chinois/anglais et de caractères aléatoires, ainsi que de meilleures performances pour les agents de code et de recherche.
  • V3.2-Exp : checkpoint expérimental du 29 septembre 2025, construit sur V3.1-Terminus et introduisant DeepSeek Sparse Attention.
  • V3.2 : successeur final de V3.2-Exp, publié le 1er décembre 2025.
  • V4 Preview : génération actuelle de l’API officielle depuis le 24 avril 2026.

V3.1-Terminus a lui-même été retiré de l’accès API courant. Au lancement de V3.2-Exp, DeepSeek ne le conservait que sur une API temporaire de comparaison, annoncée jusqu’au 15 octobre 2025. Les poids V3.1 et V3.1-Terminus restent toutefois consultables dans les dépôts officiels.

Peut-on encore accéder à DeepSeek-V3.1 ?

Voie d’accèsDisponibilité de V3.1Conseil
Chat et application DeepSeekNon comme modèle sélectionnableCes services utilisent la génération courante
API officielle DeepSeekNonN’utilisez pas un ancien alias en pensant figer V3.1
Poids officielsOuiUtilisez le dépôt vérifié deepseek-ai/DeepSeek-V3.1
Auto-hébergementOui, techniquementPrévoir une infrastructure multi-GPU et une pile compatible
Fournisseur tiersVariableVérifiez le checkpoint exact, la région, le contexte et la politique de données

Pour un projet qui doit reproduire un benchmark de 2025, V3.1 peut être un choix légitime. Pour un nouveau produit, une application ou un agent connecté à DeepSeek, partez de la documentation API DeepSeek en français et des noms de modèles actuellement publiés, pas d’un identifiant trouvé dans un ancien tutoriel.

Exemple d’auto-hébergement avec vLLM

La commande suivante reprend l’identifiant du dépôt officiel. Elle suppose que vLLM prend en charge le checkpoint et que la machine dispose de suffisamment de GPU, de mémoire et de stockage. Elle ne signifie pas que le modèle peut fonctionner sur un ordinateur portable ou une carte graphique grand public.

pip install vllm
vllm serve "deepseek-ai/DeepSeek-V3.1"

Une fois le serveur lancé localement, une requête Chat Completions minimale peut être envoyée ainsi :

curl -X POST "http://localhost:8000/v1/chat/completions" \
  -H "Content-Type: application/json" \
  --data '{
    "model": "deepseek-ai/DeepSeek-V3.1",
    "messages": [
      {"role": "user", "content": "Résume ce document en cinq points vérifiables."}
    ]
  }'

Pour contrôler précisément Think, Non-Think ou le tool calling, appliquez le template publié avec le modèle. DeepSeek précise aussi que mlp.gate.e_score_correction_bias doit être chargé et calculé en FP32 et que les poids et activations FP8 emploient le format d’échelle UE8M0. Ces détails comptent pour éviter une dégradation silencieuse de la qualité.

Quand V3.1 reste utile

  • Recherche reproductible : comparer un résultat avec les évaluations publiées en août 2025.
  • Étude des modèles hybrides : analyser le passage entre réponses directes et raisonnement dans un même checkpoint.
  • Évaluation du tool calling historique : tester le format Non-Think ou les trajectoires Search Agent fournies par DeepSeek.
  • Auto-hébergement contrôlé : conserver un checkpoint déterminé lorsque l’organisation dispose de l’infrastructure et des compétences nécessaires.
  • Migration : mesurer ce qui change entre V3.1, Terminus, V3.2 et V4 sur un corpus interne stable.

Limites à connaître avant de l’utiliser

  • Modèle obsolète pour l’API officielle : aucun identifiant actuel ne garantit l’accès à V3.1.
  • Infrastructure lourde : 685B paramètres distribués restent très loin d’un usage local ordinaire, même avec quantification.
  • Template spécifique : une intégration générique peut activer le mauvais mode ou mal parser les appels d’outils.
  • Sorties probabilistes : le mode Think n’élimine ni les hallucinations ni les erreurs de code.
  • Benchmarks éditeur : les scores officiels dépendent de prompts, frameworks d’agents et protocoles précis ; ils ne prédisent pas automatiquement vos résultats.
  • Données sensibles : avec un fournisseur hébergé, contrôlez les journaux, la conservation, la région de traitement et les conditions contractuelles. Avec un déploiement interne, ces responsabilités reviennent à votre équipe.

V3.1 ou V4 pour un nouveau projet ?

BesoinChoix conseilléPourquoi
Reproduire une expérience de 2025V3.1 ou Terminus, selon le checkpoint étudiéLa version fait partie de la variable expérimentale
Déployer exactement des poids historiquesV3.1 auto-hébergéCheckpoint identifiable et poids MIT
Créer une nouvelle application avec l’API DeepSeekV4-Flash ou V4-ProModèles officiellement servis et documentés
Traiter un contexte supérieur à 128KV4Les services V4 annoncent un contexte standard de 1M
Minimiser la migration futureV4 avec un nom de modèle expliciteÉvite les aliases historiques et les endpoints retirés

Au 20 juillet 2026, l’API officielle documente deepseek-v4-flash et deepseek-v4-pro, tous deux avec modes Thinking et Non-Thinking, 1M de contexte et un maximum de 384K tokens en sortie. Consultez la fiche DeepSeek V4 pour comparer les deux modèles, ou le guide DeepSeek local ou API avant de choisir une architecture.

FAQ sur DeepSeek V3.1

DeepSeek V3.1 est-il encore disponible dans l’API officielle ?

Non. V3.1 est un modèle historique. Les identifiants API utilisés en 2025 n’étaient pas des versions figées et ont ensuite pointé vers d’autres modèles.

Quelle différence entre V3.1 et V3.1-Terminus ?

Terminus est une mise à jour séparée publiée un mois plus tard. DeepSeek y a amélioré la cohérence linguistique et les agents de code et de recherche. Pour reproduire un résultat, indiquez toujours le checkpoint exact.

V3.1 est-il open source ?

Le dépôt et les poids officiels sont sous licence MIT. L’expression modèle à poids ouverts reste la plus précise : elle distingue les poids publiés du service Web, de l’application et de l’API exploités par DeepSeek.

Combien de paramètres possède DeepSeek-V3.1 ?

DeepSeek indique 671B paramètres pour le modèle principal et 37B activés par token. Le téléchargement complet atteint 685B en incluant 14B de paramètres du module Multi-Token Prediction.

Peut-on exécuter V3.1 sur un PC ?

Pas dans sa forme complète de manière réaliste. Une quantification réduit la mémoire, mais le modèle reste extrêmement volumineux. Le déploiement complet vise plutôt des serveurs multi-GPU ou des plateformes d’inférence spécialisées.

Le contexte de V3.1 est-il de 128K ?

Oui, la fiche officielle des poids et l’annonce API indiquent 128K. Un fournisseur tiers peut appliquer une limite différente ; sa fiche commerciale ne modifie pas la spécification publiée par DeepSeek.

Faut-il migrer une ancienne intégration V3.1 ?

Oui si elle dépend de l’API officielle. Remplacez les anciens aliases par un identifiant V4 explicite, puis retestez prompts, tool calls, formats structurés, coûts, latence et limites de sortie.

DeepSeek V3.1 peut-il répondre en français ?

Oui, le modèle peut comprendre et produire du français, mais les évaluations officielles ne garantissent pas une qualité uniforme selon le domaine. Testez séparément la terminologie française, les accents, les formats de date et de nombre, les longues consignes et vos documents métier. Pour un service destiné à la France, mesurez aussi les erreurs factuelles et le respect du format attendu sur un corpus représentatif.

Sources officielles

À retenir

DeepSeek-V3.1 a marqué le passage de la famille V3 à un fonctionnement hybride Think/Non-Think et à des usages agentiques plus avancés. Son contexte de 128K, ses poids MIT et ses templates publiés en font encore un objet d’étude utile. Il ne faut cependant plus le présenter comme un modèle disponible dans l’API officielle. Réservez-le à la reproduction, à l’évaluation historique ou à l’auto-hébergement ; pour une nouvelle application, choisissez un modèle V4 actuellement documenté et testez-le sur vos propres tâches.