Guide indépendant : deepseek-fr.ai n’est ni le site officiel de DeepSeek ni affilié à l’entreprise. Cette fiche s’appuie uniquement sur les annonces, dépôts et documents techniques publiés par DeepSeek. Dernière vérification factuelle : 20 juillet 2026.
DeepSeek V3.1 en bref
Réponse rapide : DeepSeek-V3.1 est un modèle historique à poids ouverts publié le 21 août 2025. Il a introduit, dans un même checkpoint, un mode de réponse directe Non-Think et un mode de raisonnement Think, avec 128K tokens de contexte et des capacités agentiques renforcées. Il n’est plus servi par l’API officielle de DeepSeek. Il reste pertinent pour la recherche, la reproduction d’anciens tests et l’auto-hébergement sur une infrastructure adaptée ; pour une nouvelle intégration à l’API DeepSeek, utilisez les modèles V4 actuellement documentés.
| Élément | Information vérifiée |
|---|---|
| Publication | 21 août 2025 |
| Statut actuel | Version historique ; absente de l’API officielle actuelle |
| Architecture | Mixture-of-Experts, famille DeepSeek-V3 |
| Paramètres | 671B pour le modèle principal, 37B activés par token |
| Taille complète des poids | 685B avec le module Multi-Token Prediction de 14B |
| Contexte | 128K tokens |
| Modes | Think et Non-Think |
| Poids | V3.1 et V3.1-Base publiés par DeepSeek |
| Licence | MIT pour le dépôt et les poids publiés |
| Successeur immédiat | DeepSeek-V3.1-Terminus, publié le 22 septembre 2025 |
Qu’est-ce que DeepSeek-V3.1 ?
DeepSeek-V3.1 appartient à la lignée V3 et conserve son architecture Mixture-of-Experts : le modèle possède une grande capacité totale, mais n’active qu’une partie de ses paramètres pour chaque token. DeepSeek indique 671 milliards de paramètres dans le modèle principal et 37 milliards activés par token. Les fichiers distribués représentent 685 milliards de paramètres au total, car ils incluent également un module Multi-Token Prediction de 14 milliards de paramètres.
La version V3.1-Base a poursuivi le pré-entraînement de V3 sur environ 840 milliards de tokens afin d’étendre le long contexte. La fiche officielle détaille deux phases : 630 milliards de tokens pour l’extension à 32K, puis 209 milliards pour l’extension à 128K. Le modèle conversationnel V3.1 a ensuite été post-entraîné au-dessus de cette base.
Son apport le plus visible est le raisonnement hybride. Au lieu de publier un modèle généraliste et un autre réservé au raisonnement, DeepSeek a fait fonctionner les deux comportements dans le même checkpoint en modifiant le chat template. Cette conception a servi d’étape importante vers les générations V3.2 puis V4.
Think et Non-Think : deux comportements, pas deux modèles
| Mode | À privilégier pour | Point de vigilance |
|---|---|---|
| Non-Think | Résumé, extraction, reformulation, réponses rapides et tool calling standard | Moins adapté aux problèmes nécessitant plusieurs étapes de raisonnement |
| Think | Mathématiques, débogage, planification et recherche complexe | Peut générer davantage de tokens et augmenter la latence |
Dans les poids V3.1, le mode dépend du template envoyé au modèle. Le tool calling standard est documenté en Non-Think. DeepSeek fournit aussi un format spécifique de Search Agent pour faire appel à un outil de recherche en mode Think. Cette distinction est importante : le simple fait de changer un paramètre générique dans un serveur tiers ne garantit pas que le template V3.1 correct sera appliqué.
Lors de la sortie, les identifiants API deepseek-chat et deepseek-reasoner correspondaient respectivement aux modes Non-Think et Think de V3.1. Ces noms n’étaient pas des versions figées : DeepSeek les a réaffectés à des modèles ultérieurs. Ils ne permettent donc pas de demander V3.1 aujourd’hui. DeepSeek a annoncé leur retrait définitif le 24 juillet 2026 à 15 h 59 UTC.
DeepSeek V3.1 et V3.1-Terminus : quelle différence ?
DeepSeek-V3.1-Terminus n’est ni un surnom ni un mode supplémentaire de V3.1. C’est un checkpoint mis à jour le 22 septembre 2025. DeepSeek l’a présenté comme une correction de V3.1 fondée sur les retours des utilisateurs.
- V3.1 : première version hybride du 21 août 2025.
- V3.1-Terminus : mise à jour du 22 septembre 2025, avec moins de mélanges chinois/anglais et de caractères aléatoires, ainsi que de meilleures performances pour les agents de code et de recherche.
- V3.2-Exp : checkpoint expérimental du 29 septembre 2025, construit sur V3.1-Terminus et introduisant DeepSeek Sparse Attention.
- V3.2 : successeur final de V3.2-Exp, publié le 1er décembre 2025.
- V4 Preview : génération actuelle de l’API officielle depuis le 24 avril 2026.
V3.1-Terminus a lui-même été retiré de l’accès API courant. Au lancement de V3.2-Exp, DeepSeek ne le conservait que sur une API temporaire de comparaison, annoncée jusqu’au 15 octobre 2025. Les poids V3.1 et V3.1-Terminus restent toutefois consultables dans les dépôts officiels.
Peut-on encore accéder à DeepSeek-V3.1 ?
| Voie d’accès | Disponibilité de V3.1 | Conseil |
|---|---|---|
| Chat et application DeepSeek | Non comme modèle sélectionnable | Ces services utilisent la génération courante |
| API officielle DeepSeek | Non | N’utilisez pas un ancien alias en pensant figer V3.1 |
| Poids officiels | Oui | Utilisez le dépôt vérifié deepseek-ai/DeepSeek-V3.1 |
| Auto-hébergement | Oui, techniquement | Prévoir une infrastructure multi-GPU et une pile compatible |
| Fournisseur tiers | Variable | Vérifiez le checkpoint exact, la région, le contexte et la politique de données |
Pour un projet qui doit reproduire un benchmark de 2025, V3.1 peut être un choix légitime. Pour un nouveau produit, une application ou un agent connecté à DeepSeek, partez de la documentation API DeepSeek en français et des noms de modèles actuellement publiés, pas d’un identifiant trouvé dans un ancien tutoriel.
Exemple d’auto-hébergement avec vLLM
La commande suivante reprend l’identifiant du dépôt officiel. Elle suppose que vLLM prend en charge le checkpoint et que la machine dispose de suffisamment de GPU, de mémoire et de stockage. Elle ne signifie pas que le modèle peut fonctionner sur un ordinateur portable ou une carte graphique grand public.
pip install vllm
vllm serve "deepseek-ai/DeepSeek-V3.1"
Une fois le serveur lancé localement, une requête Chat Completions minimale peut être envoyée ainsi :
curl -X POST "http://localhost:8000/v1/chat/completions" \
-H "Content-Type: application/json" \
--data '{
"model": "deepseek-ai/DeepSeek-V3.1",
"messages": [
{"role": "user", "content": "Résume ce document en cinq points vérifiables."}
]
}'
Pour contrôler précisément Think, Non-Think ou le tool calling, appliquez le template publié avec le modèle. DeepSeek précise aussi que mlp.gate.e_score_correction_bias doit être chargé et calculé en FP32 et que les poids et activations FP8 emploient le format d’échelle UE8M0. Ces détails comptent pour éviter une dégradation silencieuse de la qualité.
Quand V3.1 reste utile
- Recherche reproductible : comparer un résultat avec les évaluations publiées en août 2025.
- Étude des modèles hybrides : analyser le passage entre réponses directes et raisonnement dans un même checkpoint.
- Évaluation du tool calling historique : tester le format Non-Think ou les trajectoires Search Agent fournies par DeepSeek.
- Auto-hébergement contrôlé : conserver un checkpoint déterminé lorsque l’organisation dispose de l’infrastructure et des compétences nécessaires.
- Migration : mesurer ce qui change entre V3.1, Terminus, V3.2 et V4 sur un corpus interne stable.
Limites à connaître avant de l’utiliser
- Modèle obsolète pour l’API officielle : aucun identifiant actuel ne garantit l’accès à V3.1.
- Infrastructure lourde : 685B paramètres distribués restent très loin d’un usage local ordinaire, même avec quantification.
- Template spécifique : une intégration générique peut activer le mauvais mode ou mal parser les appels d’outils.
- Sorties probabilistes : le mode Think n’élimine ni les hallucinations ni les erreurs de code.
- Benchmarks éditeur : les scores officiels dépendent de prompts, frameworks d’agents et protocoles précis ; ils ne prédisent pas automatiquement vos résultats.
- Données sensibles : avec un fournisseur hébergé, contrôlez les journaux, la conservation, la région de traitement et les conditions contractuelles. Avec un déploiement interne, ces responsabilités reviennent à votre équipe.
V3.1 ou V4 pour un nouveau projet ?
| Besoin | Choix conseillé | Pourquoi |
|---|---|---|
| Reproduire une expérience de 2025 | V3.1 ou Terminus, selon le checkpoint étudié | La version fait partie de la variable expérimentale |
| Déployer exactement des poids historiques | V3.1 auto-hébergé | Checkpoint identifiable et poids MIT |
| Créer une nouvelle application avec l’API DeepSeek | V4-Flash ou V4-Pro | Modèles officiellement servis et documentés |
| Traiter un contexte supérieur à 128K | V4 | Les services V4 annoncent un contexte standard de 1M |
| Minimiser la migration future | V4 avec un nom de modèle explicite | Évite les aliases historiques et les endpoints retirés |
Au 20 juillet 2026, l’API officielle documente deepseek-v4-flash et deepseek-v4-pro, tous deux avec modes Thinking et Non-Thinking, 1M de contexte et un maximum de 384K tokens en sortie. Consultez la fiche DeepSeek V4 pour comparer les deux modèles, ou le guide DeepSeek local ou API avant de choisir une architecture.
FAQ sur DeepSeek V3.1
DeepSeek V3.1 est-il encore disponible dans l’API officielle ?
Non. V3.1 est un modèle historique. Les identifiants API utilisés en 2025 n’étaient pas des versions figées et ont ensuite pointé vers d’autres modèles.
Quelle différence entre V3.1 et V3.1-Terminus ?
Terminus est une mise à jour séparée publiée un mois plus tard. DeepSeek y a amélioré la cohérence linguistique et les agents de code et de recherche. Pour reproduire un résultat, indiquez toujours le checkpoint exact.
V3.1 est-il open source ?
Le dépôt et les poids officiels sont sous licence MIT. L’expression modèle à poids ouverts reste la plus précise : elle distingue les poids publiés du service Web, de l’application et de l’API exploités par DeepSeek.
Combien de paramètres possède DeepSeek-V3.1 ?
DeepSeek indique 671B paramètres pour le modèle principal et 37B activés par token. Le téléchargement complet atteint 685B en incluant 14B de paramètres du module Multi-Token Prediction.
Peut-on exécuter V3.1 sur un PC ?
Pas dans sa forme complète de manière réaliste. Une quantification réduit la mémoire, mais le modèle reste extrêmement volumineux. Le déploiement complet vise plutôt des serveurs multi-GPU ou des plateformes d’inférence spécialisées.
Le contexte de V3.1 est-il de 128K ?
Oui, la fiche officielle des poids et l’annonce API indiquent 128K. Un fournisseur tiers peut appliquer une limite différente ; sa fiche commerciale ne modifie pas la spécification publiée par DeepSeek.
Faut-il migrer une ancienne intégration V3.1 ?
Oui si elle dépend de l’API officielle. Remplacez les anciens aliases par un identifiant V4 explicite, puis retestez prompts, tool calls, formats structurés, coûts, latence et limites de sortie.
DeepSeek V3.1 peut-il répondre en français ?
Oui, le modèle peut comprendre et produire du français, mais les évaluations officielles ne garantissent pas une qualité uniforme selon le domaine. Testez séparément la terminologie française, les accents, les formats de date et de nombre, les longues consignes et vos documents métier. Pour un service destiné à la France, mesurez aussi les erreurs factuelles et le respect du format attendu sur un corpus représentatif.
Sources officielles
- Annonce DeepSeek-V3.1 — 21 août 2025
- Fiche et poids officiels DeepSeek-V3.1
- Annonce DeepSeek-V3.1-Terminus — 22 septembre 2025
- Annonce DeepSeek-V3.2-Exp et chronologie de remplacement
- Annonce DeepSeek V4 Preview et statut des anciens aliases
- Modèles actuellement servis par l’API DeepSeek
À retenir
DeepSeek-V3.1 a marqué le passage de la famille V3 à un fonctionnement hybride Think/Non-Think et à des usages agentiques plus avancés. Son contexte de 128K, ses poids MIT et ses templates publiés en font encore un objet d’étude utile. Il ne faut cependant plus le présenter comme un modèle disponible dans l’API officielle. Réservez-le à la reproduction, à l’évaluation historique ou à l’auto-hébergement ; pour une nouvelle application, choisissez un modèle V4 actuellement documenté et testez-le sur vos propres tâches.




