DeepSeek V3.2 : raisonnement, DSA et évolution vers V4

Guide indépendant : deepseek-fr.ai n’est ni le site officiel de DeepSeek ni affilié à l’entreprise. Cette fiche s’appuie uniquement sur les annonces, dépôts et rapports techniques publiés par DeepSeek. Dernière vérification factuelle : 20 juillet 2026.

DeepSeek V3.2 en bref

Réponse rapide : DeepSeek-V3.2 est un modèle historique à poids ouverts publié le 1er décembre 2025. Successeur officiel de V3.2-Exp, il combine raisonnement, utilisation d’outils en modes Thinking et Non-Thinking, et DeepSeek Sparse Attention pour rendre le long contexte plus efficace. Son contexte officiel est limité à 128K tokens. V3.2 n’est plus le modèle courant de l’API DeepSeek depuis l’arrivée de V4 Preview en avril 2026, mais ses poids MIT restent disponibles pour l’étude et l’auto-hébergement.

ÉlémentInformation vérifiée
Publication1er décembre 2025
Statut actuelVersion historique ; remplacée dans l’API officielle par V4 Preview
LignéeSuccesseur final de DeepSeek-V3.2-Exp
ArchitectureMixture-of-Experts avec DeepSeek Sparse Attention
Taille affichée du checkpoint685B paramètres dans la fiche officielle du dépôt
Contexte officiel maximal128K tokens
ModesThinking et Non-Thinking
OutilsTool use dans les deux modes pour V3.2
VariantesDeepSeek-V3.2 et DeepSeek-V3.2-Speciale
LicenceMIT pour le dépôt et les poids

Qu’est-ce que DeepSeek-V3.2 ?

DeepSeek-V3.2 est la version finalisée de la branche expérimentale lancée avec V3.2-Exp. DeepSeek l’a entraînée pour équilibrer trois objectifs : le raisonnement, les tâches agentiques et l’efficacité sur les longues séquences. Le modèle peut répondre directement, raisonner davantage lorsque la tâche l’exige et utiliser des outils externes au cours de ce raisonnement.

Cette version ne doit pas être confondue avec les modèles actuellement servis. Lors de sa sortie, V3.2 était disponible dans le Web, l’application et l’API DeepSeek. Le 24 avril 2026, DeepSeek a lancé V4 Preview et a remplacé la génération V3.2 dans ses services. Il n’existe donc plus de nom de modèle officiel permettant de demander précisément V3.2 sur l’API DeepSeek actuelle.

De V3.1-Terminus à V3.2 final : la chronologie correcte

  1. 22 septembre 2025 — V3.1-Terminus : correction de V3.1 avec une meilleure cohérence linguistique et des agents de code et de recherche renforcés.
  2. 29 septembre 2025 — V3.2-Exp : étape expérimentale construite sur Terminus pour introduire DeepSeek Sparse Attention.
  3. 1er décembre 2025 — V3.2 : modèle final de cette branche, post-entraîné pour le raisonnement et les agents.
  4. 1er décembre 2025 — V3.2-Speciale : variante à calcul d’inférence élevé, optimisée pour les problèmes difficiles, sans tool calling.
  5. 24 avril 2026 — V4 Preview : génération suivante, désormais utilisée par les services officiels.

Cette chronologie évite une erreur fréquente : V3.2-Exp n’est pas un autre nom de V3.2. Exp était un checkpoint intermédiaire destiné à valider DSA avec un entraînement aligné sur V3.1-Terminus. V3.2 final a ensuite reçu un post-entraînement supplémentaire à grande échelle.

DeepSeek Sparse Attention expliqué simplement

Dans une attention dense classique, chaque token peut comparer sa position avec toutes les positions précédentes. Le coût de ce calcul augmente très vite avec la longueur du texte. DeepSeek Sparse Attention, ou DSA, ajoute un indexeur qui sélectionne les éléments de contexte jugés les plus utiles pour chaque requête.

Dans le rapport technique, DeepSeek décrit un passage de la complexité de l’attention principale de O(L²) à O(Lk), où k représente le nombre de tokens sélectionnés et reste bien inférieur à la longueur totale L. L’indexeur conserve lui-même un coût quadratique, mais avec beaucoup moins de calcul que l’attention principale. L’objectif est donc une inférence plus efficace sur de longues séquences, pas une mémoire illimitée ni une compréhension parfaite de chaque détail.

Le rapport officiel fixe la fenêtre maximale de V3.2 à 128K tokens. Des plateformes tierces peuvent afficher une enveloppe de service différente, mais leur limite ne doit pas être présentée comme la spécification officielle du checkpoint DeepSeek.

V3.2, V3.2-Exp et V3.2-Speciale

VersionRôleTool callingStatut d’accès officiel
V3.2-ExpCheckpoint expérimental pour valider DSA, construit sur V3.1-TerminusCapacités agentiques héritées de la brancheRemplacé par V3.2 final
V3.2Version équilibrée pour raisonnement, code et agentsOui, en Thinking et Non-ThinkingHistorique ; poids toujours publiés
V3.2-SpecialeVariante à raisonnement intensif et forte consommation de tokensNonEndpoint temporaire expiré le 15 décembre 2025 ; poids toujours publiés

Au lancement, V3.2-Speciale était proposé sur un endpoint API temporaire jusqu’au 15 décembre 2025 à 15 h 59 UTC. DeepSeek indiquait le même tarif que V3.2, mais sans tool calls et avec une consommation de tokens plus élevée. Cet endpoint ne doit jamais apparaître dans un tutoriel présenté comme actuel. La variante reste accessible sous forme de poids pour la recherche et l’auto-hébergement.

Thinking in Tool-Use : ce que V3.2 a changé

DeepSeek a présenté V3.2 comme son premier modèle capable d’intégrer directement le raisonnement à l’utilisation d’outils, tout en prenant en charge les outils dans les modes Thinking et Non-Thinking. L’entraînement agentique annoncé couvre plus de 1 800 environnements et plus de 85 000 instructions complexes synthétisées.

Concrètement, un développeur peut construire une boucle où le modèle choisit un outil, l’application valide puis exécute l’appel, renvoie le résultat au modèle et reçoit une réponse finale. Le modèle n’exécute jamais lui-même une requête réseau, une commande ou une action métier. Le backend doit valider le nom de l’outil, les arguments, les permissions et les confirmations humaines.

  • N’autorisez que les outils nécessaires à la tâche.
  • Validez chaque argument avec un schéma strict côté application.
  • Ajoutez une confirmation pour les paiements, suppressions, envois ou modifications sensibles.
  • Limitez la longueur et le nombre des boucles agentiques.
  • Journalisez l’action réellement exécutée plutôt qu’une supposée « pensée interne » du modèle.

Le dépôt officiel signale aussi que son parseur d’exemple suppose une sortie bien formée et ne répare pas les réponses malformées. Il ne convient donc pas tel quel à une production sans gestion d’erreurs robuste. Pour une intégration actuelle, consultez le guide sur le function calling avec DeepSeek.

Comment accéder à DeepSeek-V3.2 aujourd’hui ?

OptionV3.2 exactÀ vérifier
Chat ou application DeepSeekNon sélectionnableCes services utilisent la génération V4 actuelle
API officielle DeepSeekNonLes noms courants sont V4-Flash et V4-Pro
Poids officiels Hugging FaceOuiCheckpoint, licence et fichiers publiés par deepseek-ai
Auto-hébergementOui, avec une infrastructure adaptéeCompatibilité runtime, mémoire GPU, stockage et chat template
Fournisseur tiersVariableIdentifiant exact, contexte, prix, région, logs et rétention

Ne configurez pas model="deepseek-v3.2" avec https://api.deepseek.com : cet identifiant n’est pas documenté dans l’API officielle actuelle. Un fournisseur tiers peut utiliser un nom similaire, mais sa base URL, ses limites et ses conditions lui sont propres.

Exemple d’auto-hébergement avec vLLM

La fiche officielle propose vLLM et SGLang pour servir les poids. L’exemple suivant est une base technique, pas une promesse de fonctionnement sur une seule machine. Un checkpoint affiché à 685B paramètres exige une infrastructure multi-GPU conséquente, même avec des optimisations.

pip install vllm
vllm serve "deepseek-ai/DeepSeek-V3.2"

Après le démarrage du serveur local :

curl -X POST "http://localhost:8000/v1/chat/completions" \
  -H "Content-Type: application/json" \
  --data '{
    "model": "deepseek-ai/DeepSeek-V3.2",
    "messages": [
      {"role": "user", "content": "Compare ces deux spécifications et liste les contradictions."}
    ],
    "temperature": 1.0,
    "top_p": 0.95
  }'

DeepSeek recommande temperature=1.0 et top_p=0.95 pour le déploiement local. Le modèle utilise un template différent des versions précédentes, notamment pour le raisonnement avec outils. Le dépôt fournit un dossier encoding et des tests pour encoder les messages puis parser les sorties. Reprenez cette logique et ajoutez vos propres validations avant une mise en production.

Cas d’usage où V3.2 reste pertinent

  • Recherche sur l’attention sparse : étudier DSA et ses compromis sur de longues séquences.
  • Reproduction de benchmarks : vérifier un résultat publié avec le checkpoint final de décembre 2025.
  • Agents auto-hébergés : tester le raisonnement avec outils dans un environnement contrôlé.
  • Code et terminal : évaluer un modèle historique sur une suite de tâches reproductible.
  • Migration vers V4 : comparer qualité, coût, latence et taux de succès sur le même corpus.
  • Infrastructure souveraine : conserver les poids et maîtriser l’exécution, à condition d’assumer l’exploitation, la sécurité et le coût matériel.

Limites documentées et précautions

  • Contexte limité à 128K : le rapport précise que certaines trajectoires de recherche dépassaient cette fenêtre et nécessitaient une gestion de contexte.
  • Auto-vérification redondante : DeepSeek a observé que V3.2 pouvait produire des trajectoires inutilement longues dans certains benchmarks d’outils.
  • Parseur d’exemple fragile : le code du dépôt ne corrige pas une sortie malformée et ne doit pas être repris tel quel en production.
  • Speciale sans outils : la variante de raisonnement intensif ne prend pas en charge le tool calling.
  • Coût local élevé : poids, GPU, stockage, réseau, supervision et maintenance doivent être comptés ensemble.
  • Hallucinations : raisonnement et tool use n’éliminent pas les erreurs factuelles, les arguments invalides ou le code dangereux.
  • Benchmarks de l’éditeur : les comparaisons avec GPT-5 ou Gemini publiées par DeepSeek reflètent son protocole ; testez vos propres tâches avant toute décision.

Si des documents contiennent des données personnelles, des secrets d’entreprise ou du code privé, choisissez explicitement l’environnement d’exécution et les règles de journalisation. L’auto-hébergement donne davantage de contrôle, mais transfère à votre organisation les responsabilités d’accès, de sécurité, de sauvegarde, de mise à jour et de réponse aux incidents.

DeepSeek V3.2 ou V4 pour un nouveau projet ?

SituationChoix conseilléRaison
Reproduire un résultat de décembre 2025V3.2 exactLe checkpoint fait partie du protocole
Étudier DSA ou le template V3.2V3.2 ou V3.2-Exp selon l’expérienceAccès aux poids et au code de référence
Construire une nouvelle application sur l’API DeepSeekV4-Flash ou V4-ProVersions actuellement servies et maintenues
Besoin de plus de 128K de contexteV4Contexte officiel standard de 1M
Raisonnement avec outils en productionV4 puis tests internesAPI actuelle, templates et documentation à jour
Contrôle intégral du checkpointV3.2 auto-hébergé ou un modèle actuel à poids ouvertsVersion figée, mais coût opérationnel important

Au 20 juillet 2026, l’API officielle expose deepseek-v4-flash et deepseek-v4-pro. DeepSeek annonce 1M de contexte, jusqu’à 384K tokens de sortie et les modes Thinking et Non-Thinking pour les deux. Pour une intégration actuelle, consultez la fiche DeepSeek V4, puis le guide déploiement local ou API.

FAQ sur DeepSeek V3.2

DeepSeek V3.2 est-il encore disponible dans l’API officielle ?

Non. Il a été remplacé par la génération V4 dans les services DeepSeek. Les poids V3.2 restent toutefois disponibles dans le dépôt officiel.

Quelle est la différence entre V3.2 et V3.2-Exp ?

V3.2-Exp est l’étape expérimentale qui a introduit DSA au-dessus de V3.1-Terminus. V3.2 est le successeur final, avec un post-entraînement renforcé pour le raisonnement et les tâches agentiques.

À quoi servait V3.2-Speciale ?

À pousser le raisonnement sur des problèmes difficiles avec davantage de tokens de calcul. Son endpoint officiel était temporaire et a expiré en décembre 2025. La variante ne prend pas en charge les appels d’outils.

DeepSeek V3.2 possède-t-il un contexte de 128K ou 164K ?

Le rapport DeepSeek fixe le maximum du modèle à 128K. Une valeur différente peut correspondre à l’enveloppe ou à la configuration d’un fournisseur tiers, pas à la spécification publiée par DeepSeek.

DeepSeek V3.2 est-il open source ?

Le dépôt et les poids sont publiés sous licence MIT. Pour éviter de confondre ces artefacts avec le service hébergé, il est plus précis de parler de modèle à poids ouverts sous licence MIT.

Peut-on faire fonctionner V3.2 sur un PC personnel ?

Pas dans sa forme complète de façon réaliste. La fiche du checkpoint affiche 685B paramètres. Les quantifications réduisent la mémoire, mais une exécution exploitable reste une tâche d’infrastructure avancée.

V3.2 peut-il raisonner tout en utilisant des outils ?

Oui pour V3.2 standard, dans les modes Thinking et Non-Thinking. Non pour V3.2-Speciale. Dans tous les cas, c’est l’application qui valide et exécute réellement les appels.

Faut-il choisir V3.2 pour une nouvelle API ?

Pas avec l’API officielle DeepSeek, qui utilise désormais V4. V3.2 reste pertinent si vous devez figer et auto-héberger ce checkpoint précis ou reproduire une expérience historique.

DeepSeek V3.2 fonctionne-t-il en français ?

Il peut traiter des consignes et produire des réponses en français, sans garantie de niveau identique pour tous les sujets. Évaluez le checkpoint exact avec vos textes français, votre terminologie et vos formats locaux ; ne déduisez pas la qualité en production d’un benchmark principalement anglais ou chinois. Pour une nouvelle intégration hébergée, réalisez ce test avec les modèles V4 actuellement servis plutôt qu’avec l’ancien endpoint V3.2.

Sources officielles

À retenir

DeepSeek-V3.2 a finalisé l’expérimentation DSA et rapproché raisonnement et utilisation d’outils dans un modèle à poids ouverts. Il reste utile pour la recherche, les benchmarks reproductibles et l’auto-hébergement avancé. Son contexte officiel est de 128K, V3.2-Speciale n’accepte pas le tool calling et aucun de ces checkpoints n’est le modèle courant de l’API DeepSeek. Pour une nouvelle intégration, commencez par V4-Flash ou V4-Pro ; revenez à V3.2 uniquement si une contrainte technique ou scientifique exige cette version exacte.