DeepSeek V4 Preview est la famille de modèles annoncée par DeepSeek le 24 avril 2026. Elle comprend deux variantes : deepseek-v4-flash, pensée pour réduire le coût et accélérer les traitements courants, et deepseek-v4-pro, plus grande et destinée aux tâches complexes. Les deux modèles disposent d’un contexte de 1 million de tokens, d’une sortie maximale de 384K tokens dans l’API Chat Completions et de modes Thinking et Non-Thinking.
Information d’indépendance : deepseek-fr.ai est un guide éditorial indépendant. Ce site n’est ni le site officiel de DeepSeek ni affilié à l’entreprise. Il ne fournit pas de service de chat et ne reçoit pas les prompts envoyés aux services officiels. Pour utiliser DeepSeek, passez par le chat officiel ou la plateforme API officielle.
Dernière vérification factuelle : 25 juillet 2026. Les caractéristiques et tarifs ci-dessous proviennent des pages officielles de DeepSeek disponibles à cette date.
DeepSeek V4 en bref
- Nom de la famille publiée : DeepSeek V4 Preview.
- Identifiants API actuels :
deepseek-v4-flashetdeepseek-v4-pro. - Architecture : modèles de langage Mixture-of-Experts, ou MoE.
- Contexte : 1M tokens pour les deux variantes.
- Sortie Chat Completions : jusqu’à 384K tokens, dans la limite du contexte total.
- Modes : Thinking activé par défaut ou Non-Thinking sur demande.
- Accès : chat et application officiels, API, ou poids téléchargeables sous licence MIT.
Ces éléments sont documentés dans l’annonce officielle de DeepSeek V4, la page officielle des modèles et tarifs et les cartes de modèles publiées par DeepSeek.
Qu’est-ce que DeepSeek V4 ?
DeepSeek V4 est une famille de grands modèles de langage à architecture MoE. Dans un modèle Mixture-of-Experts, tous les paramètres ne sont pas activés pour chaque token. DeepSeek annonce 284 milliards de paramètres au total, dont 13 milliards activés, pour V4-Flash, et 1,6 billion de paramètres au total, dont 49 milliards activés, pour V4-Pro.
Les deux modèles prennent en charge un contexte d’un million de tokens. Leur rapport technique décrit également une architecture d’attention hybride conçue pour rendre ce très long contexte plus efficace. Ces chiffres décrivent la structure et la capacité maximale annoncées ; ils ne garantissent pas, à eux seuls, qu’une réponse sera exacte ou qu’un document d’un million de tokens sera exploité uniformément.
Le terme Preview reste important : c’est le nom utilisé dans l’annonce officielle. Les modèles et leur API sont disponibles, mais les paramètres, prix ou comportements du service peuvent encore évoluer. Une application en production doit donc épingler ses tests, surveiller les modifications de documentation et prévoir une solution de repli.
DeepSeek V4-Flash ou V4-Pro : tableau comparatif
| Caractéristique | DeepSeek-V4-Flash | DeepSeek-V4-Pro |
|---|---|---|
| Identifiant API | deepseek-v4-flash | deepseek-v4-pro |
| Paramètres totaux annoncés | 284 milliards | 1,6 billion (1.6T) |
| Paramètres activés annoncés | 13 milliards | 49 milliards |
| Contexte | 1M tokens | 1M tokens |
| Sortie maximale Chat Completions | 384K tokens | 384K tokens |
| Thinking / Non-Thinking | Oui / Oui | Oui / Oui |
| JSON Output | Oui | Oui |
| Tool calls | Oui | Oui |
| Limite de concurrence standard | 2 500 par compte | 500 par compte |
| Prix de sortie par million de tokens | 0,28 $ | 0,87 $ |
Comment choisir ? V4-Flash constitue le point de départ rationnel lorsque le coût, le débit ou la rapidité comptent davantage : classification, extraction, résumé, génération de texte standard et traitement répétitif. V4-Pro mérite un test séparé pour le code complexe, la planification, le raisonnement difficile, les agents avec outils ou les tâches où une réponse insuffisante coûte plus cher que l’écart de prix.
Cette répartition est une méthode de sélection, pas une garantie de résultat. Testez les deux modèles sur un jeu représentatif de vos propres demandes. Mesurez au minimum la qualité, le respect des consignes, les erreurs factuelles, la latence et le coût réel.
Comment accéder à DeepSeek V4 en français ?
Depuis le chat ou l’application
L’annonce de lancement indique que V4 est accessible dans le chat officiel DeepSeek et l’application, via les sélections Expert Mode et Instant Mode. L’intitulé et l’emplacement du sélecteur peuvent changer avec l’interface : vérifiez le nom affiché au moment de votre utilisation au lieu de déduire un identifiant API à partir de l’apparence de l’écran.
Vous pouvez rédiger vos demandes en français. Comme pour tout modèle génératif, une réponse fluide ne prouve pas qu’elle est exacte. Vérifiez les dates, citations, calculs et décisions importantes auprès d’une source fiable. Consultez notre guide d’accès au chat officiel et notre page consacrée à l’application DeepSeek.
Depuis l’API
Pour le format OpenAI Chat Completions, l’URL de base documentée est https://api.deepseek.com. DeepSeek prend aussi en charge un format Anthropic via https://api.deepseek.com/anthropic. Cette compatibilité concerne les formats et les champs documentés par DeepSeek ; elle ne signifie pas que toutes les fonctionnalités des plateformes OpenAI ou Anthropic sont reproduites à l’identique.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "user",
"content": "Résume ce texte en français en cinq points."
}
],
extra_body={"thinking": {"type": "disabled"}},
stream=False
)
print(response.choices[0].message.content)
L’exemple désactive explicitement le mode Thinking afin que le comportement soit lisible. Pour une tâche plus difficile, vous pouvez employer deepseek-v4-pro, activer le mode Thinking et choisir l’effort high ou max. Le guide complet de l’API DeepSeek fournit aussi des exemples cURL et Node.js.
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "user",
"content": "Analyse les risques techniques de cette architecture."
}
],
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}}
)
Dans le format OpenAI, DeepSeek demande de placer thinking dans extra_body lorsqu’on utilise le SDK OpenAI. En mode Thinking, temperature, top_p, presence_penalty et frequency_penalty n’ont aucun effet. Les deux paramètres de pénalité sont par ailleurs marqués comme obsolètes dans la référence API.
Migration après le retrait de deepseek-chat et deepseek-reasoner
À mettre à jour maintenant : DeepSeek a annoncé que deepseek-chat et deepseek-reasoner seraient entièrement retirés et inaccessibles après le 24 juillet 2026 à 15 h 59 UTC. Cette échéance est passée. N’utilisez plus ces alias dans une nouvelle intégration ; remplacez-les par un identifiant V4 explicite.
Avant l’échéance, les deux anciens noms étaient routés respectivement vers le mode Non-Thinking et le mode Thinking de V4-Flash. Pour conserver cette intention dans votre code :
| Ancienne configuration | Configuration V4 explicite |
|---|---|
deepseek-chat | model="deepseek-v4-flash" avec thinking.type="disabled" |
deepseek-reasoner | model="deepseek-v4-flash" avec thinking.type="enabled" |
Pour les tâches difficiles, choisissez V4-Pro après évaluation, au lieu de supposer qu’il est un remplacement automatique de l’ancien alias. L’exemple actuellement publié dans la documentation de GET /models ne montre que deepseek-v4-flash et deepseek-v4-pro. Il s’agit de l’exemple officiel de documentation consulté le 25 juillet 2026, et non du résultat d’un appel authentifié exécuté par deepseek-fr.ai.
- Recherchez les deux anciens alias dans le code, les variables d’environnement et les tableaux de bord.
- Choisissez Flash ou Pro selon la tâche, puis définissez explicitement le mode Thinking.
- Testez les réponses, les tool calls, le streaming et les conversations multi-tours.
- Surveillez les erreurs 400, 429 et les dépassements de contexte avant le déploiement.
- Mettez à jour vos métriques de coût et vos seuils de fallback.
Contexte 1M et sortie 384K : ce que ces limites signifient
La fenêtre de contexte contient les tokens d’entrée et ceux générés. Une sortie maximale annoncée de 384K ne s’ajoute donc pas automatiquement à une entrée d’un million de tokens : la longueur totale doit rester dans la fenêtre du modèle. Le plafond de 384K concerne les réponses de Chat Completions ; ce n’est ni une longueur garantie ni le plafond de toutes les fonctions de l’API.
Pour obtenir des réponses fiables sur de très longs documents, segmentez la tâche, utilisez des repères explicites, demandez des citations internes au document et vérifiez que les éléments essentiels ont bien été pris en compte. Une grande fenêtre de contexte ne remplace pas une architecture de recherche documentaire, une stratégie de chunking ou une validation humaine.
Prix de l’API DeepSeek V4
Au 25 juillet 2026, la page tarifaire officielle affiche les montants suivants en dollars américains par million de tokens :
| Modèle | Entrée avec cache hit | Entrée avec cache miss | Sortie |
|---|---|---|---|
deepseek-v4-flash | 0,0028 $ | 0,14 $ | 0,28 $ |
deepseek-v4-pro | 0,003625 $ | 0,435 $ | 0,87 $ |
Un cache hit coûte moins cher qu’une entrée absente du cache. Il ne faut toutefois pas bâtir un budget en supposant que toutes les requêtes répétées bénéficieront du cache. DeepSeek précise que les prix peuvent changer ; consultez notre page Prix de l’API DeepSeek V4 pour les règles de calcul, puis contrôlez la source tarifaire officielle avant tout engagement.
Les limites de concurrence standard sont calculées au niveau du compte, quel que soit le nombre de clés API : 2 500 requêtes concurrentes pour V4-Flash et 500 pour V4-Pro. Une requête qui dépasse la limite reçoit un code HTTP 429. Ces plafonds ne sont pas des promesses de latence ou de débit par minute.
Mode Thinking et mode Non-Thinking
Les deux modèles prennent en charge les deux modes. Le mode Thinking est activé par défaut dans l’API documentée. Il renvoie le raisonnement dans le champ reasoning_content et la réponse finale dans content. Les efforts officiellement acceptés sont high et max ; low et medium sont mappés vers high, tandis que xhigh est mappé vers max.
Le mode Thinking n’est pas nécessaire pour chaque requête. Le désactiver peut convenir aux extractions simples, aux reformulations et aux classifications. Pour les tâches complexes, testez high avant max et mesurez le gain réel. Avec des tool calls, la documentation impose de renvoyer correctement reasoning_content dans les tours concernés ; sinon l’API peut répondre par une erreur 400.
JSON, outils et FIM : fonctionnalités et précautions
- JSON Output : disponible sur Flash et Pro avec
response_format={"type":"json_object"}. - Tool calls : disponibles sur les deux modèles, y compris en mode Thinking.
- Chat Prefix Completion : fonction bêta disponible sur les deux modèles selon le tableau officiel.
- FIM Completion : fonction bêta en mode Non-Thinking, avec une URL de base
https://api.deepseek.com/betaet un maximum documenté de 4K tokens.
Une incohérence subsiste dans les sources officielles au 25 juillet 2026 : le tableau « Models & Pricing » marque FIM comme disponible pour Flash et Pro, tandis que la référence de l’endpoint /completions n’accepte explicitement que deepseek-v4-pro. Pour une intégration qui doit suivre strictement la référence actuelle, utilisez V4-Pro pour FIM et considérez la prise en charge de V4-Flash comme non confirmée jusqu’à clarification de DeepSeek. Le plafond FIM de 4K ne doit pas être confondu avec la sortie Chat Completions de 384K.
Poids ouverts et exécution locale
DeepSeek publie les poids des variantes V4 sur son espace Hugging Face. Les cartes officielles indiquent que le dépôt et les poids sont sous licence MIT. Le terme open-weight, ou poids ouverts, est le plus précis : il confirme l’accès aux poids sous licence, mais ne signifie pas que les données d’entraînement et toute l’infrastructure de création du modèle sont intégralement reproductibles.
Une exécution locale est techniquement documentée, mais la taille des modèles la réserve à une infrastructure spécialisée. V4-Flash totalise 284 milliards de paramètres et V4-Pro 1,6 billion. Ne déduisez pas une configuration matérielle fiable à partir du seul nombre de paramètres : la mémoire dépend de la précision, du runtime, du parallélisme, du KV cache et de la longueur de contexte. Utilisez les instructions officielles du dépôt et validez la compatibilité de votre matériel avant de télécharger les poids.
Pour approfondir ce choix, consultez notre guide exécuter DeepSeek localement. Pour une petite équipe sans infrastructure GPU adaptée, l’API est généralement plus simple à tester ; cela ne dispense pas d’examiner la confidentialité et les conditions applicables.
Confidentialité, exactitude et limites
La politique de confidentialité officielle indique notamment que les services peuvent collecter les entrées, fichiers, historiques, données de compte et données techniques. Elle précise que les données personnelles fournies aux services sont directement collectées, traitées et stockées en République populaire de Chine, et que certaines données peuvent servir à développer et entraîner les technologies de DeepSeek. Elle permet aussi, selon les paramètres et la juridiction, de s’opposer à l’utilisation de données pour l’entraînement.
Ne transmettez pas de secrets, clés API, mots de passe, données médicales, documents clients ou informations contractuelles confidentielles sans analyse juridique et technique adaptée. La politique des services officiels ne décrit pas automatiquement le traitement effectué par chaque application tierce construite avec l’API. L’opérateur de cette application doit publier ses propres règles et sécuriser son traitement.
- Erreurs factuelles : DeepSeek avertit que ses sorties peuvent être inexactes ; vérifiez les faits importants.
- Texte uniquement dans les formats documentés : l’API Anthropic de DeepSeek indique que les contenus de type image et document ne sont pas pris en charge directement dans les messages.
- Version Preview : surveillez les changements d’identifiants, de prix et de comportement.
- Contexte maximal : 1M n’assure pas une attention uniforme ni une réponse de meilleure qualité.
- Benchmarks : les scores publiés par l’éditeur ne remplacent pas une évaluation sur vos données.
Consultez aussi notre politique de confidentialité pour distinguer le traitement réalisé lors de la consultation de deepseek-fr.ai de celui réalisé lorsque vous quittez ce site pour utiliser DeepSeek.
Méthode de test avant une mise en production
- Constituez un jeu de demandes réelles, sans données personnelles non nécessaires.
- Testez Flash et Pro avec les mêmes consignes, puis séparez Thinking et Non-Thinking.
- Notez l’exactitude, le respect du format, les refus, les hallucinations et la stabilité.
- Mesurez les tokens de cache hit, cache miss et sortie afin de calculer le coût réel.
- Testez les erreurs, timeouts, limites de concurrence, reprises et solutions de repli.
- Faites valider les cas à fort impact par une personne compétente avant automatisation.
Une stratégie simple consiste à utiliser Flash comme candidat pour les tâches courantes, puis à router vers Pro les demandes qui dépassent un seuil de complexité défini et testé. Cette règle doit être basée sur vos mesures, pas sur le nom commercial des modèles.
FAQ sur DeepSeek V4
DeepSeek V4 est-il réellement disponible ?
Oui. DeepSeek a annoncé V4 Preview le 24 avril 2026 et documente ses deux modèles dans l’API. Les identifiants actuels sont deepseek-v4-flash et deepseek-v4-pro.
Quelle est la différence entre DeepSeek V4-Flash et V4-Pro ?
Flash est plus petit et moins cher : 284 milliards de paramètres au total, dont 13 milliards activés. Pro compte 1,6 billion de paramètres, dont 49 milliards activés, et coûte davantage. Les deux partagent le contexte 1M, la sortie Chat Completions maximale de 384K et les modes Thinking et Non-Thinking.
DeepSeek V4 est-il gratuit ?
L’API est facturée selon les tokens. Les poids peuvent être téléchargés sous licence MIT, mais leur stockage et leur exécution entraînent des coûts matériels ou cloud. Les conditions d’accès au chat officiel peuvent évoluer ; vérifiez-les directement dans le service.
Le mode Thinking est-il activé par défaut ?
Oui, dans la documentation API actuelle. Vous pouvez le désactiver avec {"thinking":{"type":"disabled"}}. En mode Thinking, les niveaux d’effort documentés sont high et max.
Puis-je encore utiliser deepseek-chat ou deepseek-reasoner ?
Ne les utilisez plus dans une nouvelle intégration. DeepSeek a annoncé leur retrait complet après le 24 juillet 2026 à 15 h 59 UTC, une échéance désormais passée. La documentation de la liste des modèles montre actuellement uniquement les deux identifiants V4, sans que deepseek-fr.ai présente cet exemple comme un test authentifié de l’API.
DeepSeek V4 est-il open source ?
DeepSeek emploie le terme « open-sourced » et publie le dépôt et les poids sous licence MIT. Pour éviter une interprétation trop large, cette page parle de poids ouverts : l’accès aux poids ne garantit pas la publication de toutes les données et méthodes nécessaires pour reproduire intégralement l’entraînement.
Le contexte 1M permet-il une sortie d’un million de tokens ?
Non. La fenêtre totale est de 1M tokens et la sortie maximale indiquée pour Chat Completions est de 384K. L’entrée et la sortie doivent rester dans la fenêtre totale, et le plafond de sortie n’est pas une longueur garantie.
DeepSeek V4 peut-il analyser directement des images ?
Les formats API documentés pour V4 sont textuels. La page de compatibilité Anthropic marque les messages de type image et document comme non pris en charge. Un outil tiers peut convertir une image ou un document en texte avant de l’envoyer au modèle, mais ce prétraitement n’est pas une capacité visuelle native de l’API V4 documentée.
Sources officielles consultées
- DeepSeek V4 Preview Release — annonce, variantes, disponibilité et retrait des anciens alias.
- Models & Pricing — contexte, sortie maximale, fonctions, prix et concurrence.
- Lists Models — exemple actuel de la liste des identifiants de modèles.
- Thinking Mode — activation, effort, paramètres et conversations avec outils.
- Rate Limit & Isolation — limites par compte, code 429 et isolation
user_id. - FIM Completion (Beta) et référence de l’endpoint FIM.
- Anthropic API — URL de base et matrice de compatibilité.
- Carte officielle DeepSeek-V4-Flash et carte officielle DeepSeek-V4-Pro — architecture, tailles, poids et licence.
- Politique de confidentialité de DeepSeek — catégories de données, finalités, droits et lieu de stockage.
À lire ensuite : prix de l’API DeepSeek V4, guide de l’API DeepSeek, DeepSeek V3.1, DeepSeek R1 et DeepSeek pour le code.




