DeepSeekMath, souvent recherché sous la forme « DeepSeek Math », est une lignée de modèles consacrés au raisonnement mathématique. Elle comprend la famille originale de trois checkpoints 7B — Base, Instruct et RL — puis DeepSeekMath-V2, un modèle beaucoup plus récent centré sur la génération et la vérification de démonstrations. Ces poids sont publiés par DeepSeek, mais DeepSeekMath n’est pas le nom d’un modèle disponible dans l’API officielle actuelle.
Réponse courte : le DeepSeekMath 7B original reste utile pour apprendre, expérimenter et exécuter un modèle mathématique relativement compact. DeepSeekMath-V2 vise la recherche avancée sur les preuves et demande une infrastructure bien plus importante. Pour une application hébergée via l’API DeepSeek, utilisez un modèle V4 actuel et validez chaque résultat avec un outil déterministe.
Dernière vérification : 20 juillet 2026. Ce guide est indépendant et n’est ni édité ni approuvé par DeepSeek.
Statut des modèles DeepSeekMath
| Modèle | But principal | Accès officiel | Statut en 2026 |
|---|---|---|---|
| DeepSeekMath-Base 7B | Complétion, recherche et adaptation | Poids Hugging Face | Checkpoint historique, toujours téléchargeable |
| DeepSeekMath-Instruct 7B | Résolution guidée par consigne | Poids Hugging Face | Checkpoint historique, pratique en local |
| DeepSeekMath-RL 7B | Raisonnement affiné par GRPO | Poids Hugging Face | Checkpoint de recherche historique |
| DeepSeekMath-V2 | Preuves auto-vérifiables | Poids Hugging Face et dépôt GitHub | Publication plus récente, très exigeante en infrastructure |
| DeepSeek-V4 | Raisonnement général, mathématiques, code et agents | Web, application et API | Famille actuellement servie par DeepSeek |
Au 20 juillet 2026, la documentation de l’API liste deepseek-v4-flash et deepseek-v4-pro. Elle ne liste ni deepseek-math ni DeepSeek-Math-V2. Un fournisseur tiers peut proposer ces poids sous son propre service, mais il ne s’agit alors pas de l’API officielle DeepSeek.
DeepSeekMath 7B original : trois checkpoints différents
La première génération DeepSeekMath part de DeepSeek-Coder-v1.5 7B, puis poursuit son préentraînement sur 500 milliards de tokens mêlant mathématiques, langage naturel et code. DeepSeek a publié trois versions, chacune avec une longueur de séquence documentée de 4 096 tokens.
| Version 7B | Ce qu’elle représente | Choisissez-la si… |
|---|---|---|
| Base | Fondation après préentraînement mathématique | vous étudiez le modèle, faites de la complétion ou préparez une adaptation |
| Instruct | Base ajustée sur des consignes mathématiques | vous voulez poser directement des problèmes et obtenir une solution structurée |
| RL | Instruct entraîné ensuite avec l’algorithme GRPO | vous analysez le raisonnement renforcé et acceptez un comportement plus expérimental |
Le score de 51,7 % souvent cité correspond au benchmark MATH, dans le protocole décrit par les auteurs, sans outils externes ni vote. Ce nombre ne signifie pas « 51,7 % de toutes les mathématiques » et ne mesure ni la fiabilité sur un programme français, ni la précision sur vos données. Les benchmarks restent des points de comparaison, pas une garantie.
DeepSeekMath-V2 : une autre échelle et un autre objectif
DeepSeekMath-V2 n’est pas un « DeepSeekMath 7B amélioré ». Il est construit sur DeepSeek-V3.2-Exp-Base et cherche à rendre le raisonnement mathématique plus vérifiable. Le projet entraîne un vérificateur de preuves, puis utilise ce signal pour améliorer un générateur capable de détecter et corriger des lacunes dans ses propres démonstrations.
La fiche officielle publie les poids sous Apache 2.0 et décrit un checkpoint de très grande taille. DeepSeek ne fournit pas de déclinaison V2 officielle en 7B. Il faut donc éviter les tutoriels qui présentent un simple chargement sur un ordinateur grand public comme une voie réaliste : le téléchargement, le stockage et l’inférence exigent une infrastructure serveur adaptée et le moteur recommandé pour DeepSeek-V3.2-Exp.
Les résultats annoncés sur IMO 2025, CMO 2024 et Putnam 2024 utilisent du calcul augmenté au moment de l’inférence. Ils ne signifient pas qu’une génération unique répondra toujours correctement, ni que le modèle peut valider de manière autonome une preuve destinée à la publication.
DeepSeekMath, DeepSeekMath-V2 ou DeepSeek-V4 ?
| Votre besoin | Point de départ | Contrôle indispensable |
|---|---|---|
| Apprentissage ou prototype local | DeepSeekMath-Instruct 7B | Recalculer chaque étape et tester sur le programme visé |
| Recherche sur GRPO | DeepSeekMath-RL 7B | Reproduire le protocole et comparer à Instruct |
| Recherche sur les démonstrations | DeepSeekMath-V2 | Infrastructure, protocole de vérification et budget de calcul |
| Application en ligne via API officielle | DeepSeek-V4-Pro ou Flash selon le besoin | Calculatrice, CAS, tests ou règles déterministes |
| Calcul financier, médical ou réglementaire | Aucun LLM seul | Moteur de calcul audité et validation par un spécialiste |
V4 offre le service actuel, une longue fenêtre de contexte et une maintenance côté API. Le DeepSeekMath 7B original offre au contraire un artefact léger et reproductible que vous contrôlez. DeepSeekMath-V2 est pertinent si votre sujet est précisément la génération de preuves auto-vérifiables et si vous disposez des ressources nécessaires.
Installer DeepSeekMath-Instruct 7B en local
L’exemple officiel le plus accessible utilise Transformers. Une carte compatible CUDA est vivement préférable. En BF16, les poids 7B représentent déjà un ordre de grandeur d’environ 14 Go avant le cache KV, les activations et les surcoûts ; la machine doit donc disposer d’une marge supplémentaire. La quantification peut réduire la mémoire, avec un impact possible sur la qualité et la compatibilité.
python -m venv .venv
source .venv/bin/activate
# Sous Windows PowerShell : .venv\Scripts\Activate.ps1
pip install torch transformers accelerate
import torch
from transformers import (
AutoModelForCausalLM,
AutoTokenizer,
GenerationConfig,
)
MODEL_ID = "deepseek-ai/deepseek-math-7b-instruct"
tokenizer = AutoTokenizer.from_pretrained(MODEL_ID)
model = AutoModelForCausalLM.from_pretrained(
MODEL_ID,
torch_dtype="auto",
device_map="auto",
)
model.generation_config = GenerationConfig.from_pretrained(MODEL_ID)
model.generation_config.pad_token_id = model.generation_config.eos_token_id
model.eval()
problem = r"""
Dans un repère orthonormé, on considère A(1, 2), B(5, 2) et C(3, 6).
Calcule l’aire du triangle ABC de deux façons indépendantes.
Détaille les étapes, vérifie la cohérence géométrique et place la réponse finale
dans \boxed{}.
""".strip()
messages = [{"role": "user", "content": problem}]
input_ids = tokenizer.apply_chat_template(
messages,
add_generation_prompt=True,
return_tensors="pt",
).to(model.device)
with torch.inference_mode():
output_ids = model.generate(
input_ids,
max_new_tokens=512,
do_sample=False,
)
answer = tokenizer.decode(
output_ids[0, input_ids.shape[1]:],
skip_special_tokens=True,
)
print(answer)
La documentation de cette génération déconseille l’ajout d’un message système. Elle recommande également une consigne de raisonnement étape par étape et une réponse finale dans \boxed{} pour les versions Instruct et RL. Respectez le gabarit du tokenizer au lieu d’inventer un format de conversation.
Comment vérifier une réponse mathématique
- Reformulez les hypothèses : unités, domaine des variables, arrondis et contraintes.
- Demandez deux méthodes : par exemple algèbre puis géométrie, ou calcul symbolique puis substitution numérique.
- Contrôlez le résultat : exécutez un script, une calculatrice ou un système de calcul formel lorsque cela est approprié.
- Testez les bornes : signe, ordre de grandeur, cas zéro et valeurs extrêmes.
- Séparez preuve et réponse : une valeur finale correcte ne garantit pas que le raisonnement soit valide.
- Conservez une revue humaine : indispensable pour l’enseignement évalué, la recherche et les décisions à risque.
Pour un exercice scolaire, utilisez le modèle comme tuteur : demandez un indice, une explication d’erreur ou une méthode alternative avant la solution complète. Pour une preuve, exigez que chaque implication soit justifiée et vérifiez séparément les lemmes critiques.
Prompts utiles en français
Un bon prompt mathématique précise le domaine, les hypothèses, la méthode de contrôle et le format final. Il ne suffit pas d’ajouter « raisonne étape par étape ».
Obtenir un indice sans révéler la solution
Tu es un tuteur de terminale générale. Ne donne pas la solution complète.
Repère la première erreur dans mon raisonnement, explique la notion concernée
et pose une question qui me permette de reprendre. Utilise la notation du
programme français et indique explicitement toute hypothèse manquante.
Contrôler une démonstration
Examine cette preuve ligne par ligne. Pour chaque implication, indique :
1. la règle ou le théorème utilisé ;
2. les hypothèses nécessaires ;
3. si l’étape est valide, incomplète ou fausse.
Ne répare la preuve qu’après le diagnostic. Sépare les erreurs locales
d’une conclusion qui pourrait être vraie pour une autre raison.
Produire un résultat vérifiable par programme
Résous ce problème d’optimisation sous les contraintes données.
Fournis : la formulation mathématique, les conditions d’optimalité,
le résultat exact, une approximation à six décimales et un court script Python
qui vérifie la solution. N’utilise aucune bibliothèque non mentionnée.
Le script proposé par le modèle doit lui-même être relu. Un LLM peut construire un « vérificateur » qui répète la même erreur que sa solution. Pour une vraie indépendance, utilisez une méthode différente, un autre outil ou un jeu de valeurs dont la réponse est déjà connue.
Évaluer le modèle sur un programme français
- Créez un échantillon équilibré : calcul, fonctions, probabilités, géométrie, raisonnement et rédaction.
- Étiquetez séparément la réponse finale, les étapes, la notation et le respect du niveau demandé.
- Comptez les solutions qui paraissent convaincantes mais contiennent une implication invalide.
- Mesurez l’effet de la langue en posant les mêmes problèmes en français et en anglais.
- Testez les variations d’énoncé pour détecter la mémorisation ou la fragilité.
- Faites corriger l’échantillon par une personne compétente sans lui montrer le nom du modèle.
Pour DeepSeekMath-V2, ajoutez le budget de calcul à la mesure : nombre de générations, tours de vérification et temps total. Une performance obtenue avec plusieurs candidats et un vérificateur ne doit pas être comparée à une sortie unique de DeepSeekMath 7B comme si le protocole était identique.
Usages utiles et limites
- Utile pour : expliquer une notion, proposer un plan de résolution, produire des exercices, traduire une notation en code et comparer plusieurs approches.
- À valider fortement : démonstrations, statistiques, optimisation, comptabilité, fiscalité et calcul scientifique.
- Non garanti : absence d’hallucination, exactitude numérique, conformité au programme scolaire français ou validité formelle d’une preuve.
- Contexte limité : la famille 7B originale documente 4 096 tokens, partagés entre l’énoncé, l’historique et la réponse.
- Langue : les évaluations publiées se concentrent surtout sur l’anglais et le chinois ; testez explicitement le français et la notation utilisée par votre public.
Licences des deux générations
| Élément | Licence officielle | Conséquence |
|---|---|---|
| Code DeepSeekMath 7B | MIT | Licence du dépôt, distincte des poids |
| Poids DeepSeekMath 7B | DeepSeek Model License | Usage commercial annoncé comme permis sous ses conditions |
| Dépôt et poids DeepSeekMath-V2 | Apache 2.0 | Conditions Apache 2.0 applicables au checkpoint V2 officiel |
La licence dépend donc de la génération et du fichier exact. Conservez l’identifiant du checkpoint, sa révision et une copie de la licence examinée. N’utilisez pas « open source » comme formule unique pour des modèles régis par des textes différents.
Questions fréquentes
DeepSeekMath est-il accessible dans l’API DeepSeek ?
Pas sous un identifiant dédié. L’API actuelle sert DeepSeek-V4-Flash et DeepSeek-V4-Pro. Les modèles Math se téléchargent comme poids séparés ou peuvent être servis par un prestataire tiers clairement identifié.
Quelle version 7B choisir pour poser des questions ?
Instruct est le point de départ le plus simple. Base vise plutôt la complétion et l’adaptation ; RL sert à étudier l’effet du renforcement GRPO.
DeepSeekMath-V2 peut-il tourner sur un PC ?
Pas dans sa forme officielle complète sur un PC ordinaire. Le checkpoint est d’une toute autre échelle que 7B et vise une infrastructure serveur. Méfiez-vous des tutoriels qui confondent V2 avec une quantification communautaire ou le modèle original.
Une réponse dans \boxed{} est-elle nécessairement correcte ?
Non. Cette convention facilite l’extraction de la réponse finale ; elle ne valide ni le calcul ni la démonstration.
Peut-on utiliser ces modèles pour enseigner en France ?
Oui comme outil d’assistance, après évaluation sur le niveau et le programme concernés. L’enseignant doit contrôler la notation, la méthode et le résultat, et éviter d’envoyer des données personnelles d’élèves à un service non évalué.
Sources officielles
- Dépôt officiel DeepSeekMath 7B
- Collection officielle DeepSeek Math sur Hugging Face
- Dépôt officiel DeepSeekMath-V2
- Fiche et poids officiels DeepSeekMath-V2
- Annonce officielle DeepSeek-V4 et changement de génération API
- Modèles de l’API officielle actuelle
Pour comparer avec la génération servie aujourd’hui, consultez notre fiche DeepSeek-V4 et le guide DeepSeek local ou API.




