Dernière mise à jour : 10 juillet 2026
DeepSeek V4 est la nouvelle génération de modèles IA de DeepSeek, disponible en version Preview avec deux variantes principales : DeepSeek-V4-Pro et DeepSeek-V4-Flash. Selon l’annonce officielle, DeepSeek V4 est accessible via le web, l’application et l’API, avec des poids ouverts et une fenêtre de contexte pouvant atteindre 1 million de tokens.
L’intérêt de DeepSeek V4 ne se limite pas à ses performances brutes. Le modèle vise surtout les usages où le coût, le contexte long, le raisonnement, le code et les agents IA comptent : analyse de grands documents, assistants développeurs, workflows automatisés, recherche documentaire, génération de code et intégration API à grande échelle.
À retenir
- DeepSeek V4 existe officiellement : il a été annoncé comme “DeepSeek V4 Preview” le 24 avril 2026.
- Deux modèles sont proposés : V4-Pro pour les tâches exigeantes et V4-Flash pour les usages rapides et économiques.
- Les deux modèles prennent en charge un contexte total de 1M tokens et une sortie maximale de 384K tokens. La somme des tokens d’entrée et des tokens générés ne peut toutefois pas dépasser la fenêtre de contexte du modèle.
- L’API est compatible avec les formats OpenAI Chat Completions et Anthropic, ce qui facilite la migration depuis des outils existants.
- Les poids sont publiés sur Hugging Face sous licence MIT, mais les deux modèles restent très volumineux : V4-Flash compte 284 milliards de paramètres et V4-Pro 1 600 milliards. Leur exécution complète exige généralement une infrastructure multi-GPU de classe serveur ou centre de données.
- DeepSeek V4 est un modèle textuel : il ne traite pas nativement les images, l’audio ou la vidéo. Dans l’extension GitHub Copilot documentée, les images sont décrites par un autre modèle proxy avant que le texte résultant soit envoyé à DeepSeek V4.
Qu’est-ce que DeepSeek V4 ?
DeepSeek V4 est une famille de grands modèles de langage de type Mixture-of-Experts. La série comprend notamment DeepSeek-V4-Pro, annoncé avec 1 600 milliards de paramètres au total — soit 1.6T dans la documentation anglophone — et 49 milliards de paramètres activés, et DeepSeek-V4-Flash, annoncé avec 284 milliards de paramètres au total et 13 milliards activés. Les deux modèles prennent en charge une fenêtre de contexte d’un million de tokens.
En pratique, cela signifie que DeepSeek V4 peut traiter des entrées très longues : grands rapports, bases documentaires, tickets techniques, contrats, historiques de conversation, dépôts de code ou briefs complexes. Le contexte 1M ne garantit pas automatiquement une meilleure réponse, mais il permet d’inclure beaucoup plus d’informations dans une seule requête qu’un modèle à contexte plus court.
DeepSeek présente V4 comme une génération optimisée pour trois axes : contexte long, raisonnement et agents IA. L’architecture introduit notamment une attention hybride combinant CSA et HCA, des connexions mHC et l’optimiseur Muon, selon le rapport technique publié sur Hugging Face et arXiv.
DeepSeek V4-Pro vs DeepSeek V4-Flash
Le choix entre V4-Pro et V4-Flash dépend surtout de votre arbitrage entre qualité, coût, latence et complexité de la tâche.
| Critère | DeepSeek-V4-Flash | DeepSeek-V4-Pro |
|---|---|---|
| Nom API | deepseek-v4-flash | deepseek-v4-pro |
| Paramètres totaux annoncés | 284 milliards | 1 600 milliards (1.6T) |
| Paramètres activés annoncés | 13B | 49B |
| Fenêtre de contexte | 1M tokens | 1M tokens |
| Sortie maximale API | 384K tokens | 384K tokens |
| Mode Thinking | Oui | Oui |
| JSON Output | Oui | Oui |
| Tool Calls | Oui | Oui |
| Prix input cache hit / 1M tokens | $0.0028 | $0.003625 |
| Prix input cache miss / 1M tokens | $0.14 | $0.435 |
| Prix output / 1M tokens | $0.28 | $0.87 |
| Limite de concurrence par compte | 2 500 | 500 |
| Meilleur choix pour | Volume, coût, réponses rapides | Raisonnement, code complexe, agents, tâches critiques |
Les prix ci-dessus proviennent de la page officielle “Models & Pricing” de DeepSeek, consultée le 10 juillet 2026. DeepSeek précise que ses prix peuvent évoluer et recommande de vérifier régulièrement la page tarifaire officielle.
Quand choisir DeepSeek-V4-Flash ?
Choisissez V4-Flash si votre priorité est le coût ou le débit. C’est le meilleur point de départ pour :
- chatbots à fort volume ;
- résumé de documents ;
- classification ;
- extraction d’informations ;
- génération de contenu standard ;
- workflows internes peu risqués ;
- prétraitement de grands corpus ;
- agents simples où la latence compte.
V4-Flash est aussi le choix logique pour tester DeepSeek V4 sans engager immédiatement un budget important.
Quand choisir DeepSeek-V4-Pro ?
Choisissez V4-Pro si la tâche exige une meilleure robustesse sur le raisonnement, le code, la planification ou les agents multi-étapes. C’est le meilleur choix pour :
- refactorisation de code complexe ;
- analyse de bugs ;
- raisonnement mathématique ou logique ;
- agents IA avec outils ;
- analyse de grands dépôts ;
- extraction et synthèse depuis de très longs documents ;
- décisions où une erreur coûte plus cher que la différence de prix API.
V4-Pro n’est pas forcément nécessaire pour chaque requête. Une architecture efficace peut router les demandes simples vers V4-Flash et réserver V4-Pro aux tâches difficiles.
Ce qui change par rapport à DeepSeek V3, V3.2 et R1
La différence majeure est que DeepSeek V4 consolide plusieurs axes dans une même famille : contexte 1M, modes Thinking/Non-Thinking, intégration agentique, API compatible OpenAI/Anthropic et poids ouverts. DeepSeek V3.2 avait déjà introduit le thinking dans le tool-use selon l’annonce officielle de décembre 2025, mais V4 pousse davantage l’efficacité du contexte long et les usages agentiques.
Transition des anciens noms API : DeepSeek a annoncé que deepseek-chat et deepseek-reasoner resteraient accessibles jusqu’au 24 juillet 2026 à 15:59 UTC, en pointant respectivement vers les modes non-thinking et thinking de deepseek-v4-flash. Ils doivent ensuite devenir inaccessibles. Pour toute nouvelle intégration, utilisez directement deepseek-v4-flash ou deepseek-v4-pro.
Pour une nouvelle intégration, mieux vaut donc utiliser directement :
deepseek-v4-flashdeepseek-v4-pro
Cela évite une migration forcée après la dépréciation des anciens noms.
Prix de l’API DeepSeek V4
Les tarifs officiels vérifiés le 10 juillet 2026 sont les suivants :
| Modèle | Input cache hit | Input cache miss | Output |
|---|---|---|---|
deepseek-v4-flash | $0.0028 / 1M tokens | $0.14 / 1M tokens | $0.28 / 1M tokens |
deepseek-v4-pro | $0.003625 / 1M tokens | $0.435 / 1M tokens | $0.87 / 1M tokens |
La différence entre cache hit et cache miss est essentielle. Si une partie de votre prompt correspond entièrement à une unité de préfixe déjà persistée, le coût d’entrée peut baisser fortement. DeepSeek indique que le context caching est activé par défaut, fonctionne en mode « best effort » et ne garantit pas un cache hit à chaque requête. Les entrées inutilisées sont généralement supprimées après quelques heures à quelques jours. Pour isoler le KV cache entre les utilisateurs de votre application, utilisez le paramètre user_id conformément à la documentation, sans y placer d’information personnelle.
Reuters a rapporté en mai 2026 que DeepSeek avait rendu permanente une réduction de 75 % du prix de V4-Pro par rapport au tarif initial. L’article précise toutefois que DeepSeek n’a pas indiqué si cette baisse résultait d’une disponibilité accrue des puces Huawei Ascend 950. Pour les utilisateurs, la source de vérité reste la page tarifaire officielle au moment de l’achat.
Comment utiliser DeepSeek V4 via l’API
Pour l’interface compatible OpenAI Chat Completions, utilisez base_url="https://api.deepseek.com" avec le modèle deepseek-v4-pro ou deepseek-v4-flash. Pour l’interface compatible Anthropic, la base URL documentée est https://api.deepseek.com/anthropic. Les deux interfaces sont prises en charge, mais elles n’utilisent pas la même URL de base.
Exemple Python minimal avec l’API compatible OpenAI
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "system",
"content": "Tu es un assistant technique concis et fiable."
},
{
"role": "user",
"content": "Résume les avantages de DeepSeek V4 pour une équipe produit SaaS."
}
],
stream=False
)
print(response.choices[0].message.content)
Pour une tâche plus complexe, remplacez simplement le modèle par :
model="deepseek-v4-pro"
Activer ou contrôler le mode Thinking
Le mode Thinking est activé par défaut selon la documentation. En format OpenAI, DeepSeek documente l’usage de reasoning_effort avec les valeurs high ou max, ainsi que le paramètre thinking dans extra_body.
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "user",
"content": "Analyse les risques techniques d'une migration vers une architecture multi-agent."
}
],
reasoning_effort="high",
extra_body={
"thinking": {
"type": "enabled"
}
}
)
Pour les conversations avec tool calls en mode Thinking, DeepSeek précise que le champ reasoning_content doit être correctement renvoyé dans les tours suivants lorsque des outils sont utilisés, sinon l’API peut retourner une erreur 400.
DeepSeek V4 pour les agents IA et le code
DeepSeek met clairement l’accent sur les usages agentiques. L’annonce officielle mentionne une intégration avec des outils comme Claude Code, OpenClaw et OpenCode, et la documentation fournit des guides d’intégration pour plusieurs assistants de codage.
Les cas d’usage les plus pertinents sont :
| Cas d’usage | Modèle conseillé | Pourquoi |
|---|---|---|
| Assistant de code terminal | V4-Pro | Meilleur choix pour les tâches longues et les corrections complexes |
| Génération de snippets simples | V4-Flash | Moins cher, plus rapide |
| Analyse d’un grand dépôt | V4-Pro | Contexte 1M et meilleure robustesse |
| Revue de PR répétitive | V4-Flash ou routage hybride | Flash suffit souvent, Pro pour les PR sensibles |
| Agent multi-outils | V4-Pro | Plus adapté aux raisonnements en plusieurs étapes |
| Support client technique | V4-Flash | Coût plus faible à grande échelle |
DeepSeek documente aussi une extension tierce pour GitHub Copilot Chat qui ajoute V4-Pro et V4-Flash dans le sélecteur de modèles, mais précise que cette intégration est fournie par un tiers et n’est pas garantie par DeepSeek.
Benchmarks : que valent les performances de DeepSeek V4 ?
Les benchmarks publiés sur Hugging Face indiquent que DeepSeek-V4-Pro et V4-Flash progressent par rapport à DeepSeek-V3.2 sur plusieurs tâches de connaissance, de raisonnement, de code et de contexte long. Par exemple, le tableau des modèles de base indique un score MMLU-Pro de 73.5 pour V4-Pro-Base contre 68.3 pour V4-Flash-Base et 65.5 pour V3.2-Base.
Pour les modèles instruct, la carte Hugging Face montre aussi des scores différenciés selon les modes Non-Think, High et Max. Sur LiveCodeBench, le tableau indique notamment 93.5 pour V4-Pro Max et 91.6 pour V4-Flash Max. Sur SWE Verified, il indique 80.6 pour V4-Pro Max et 79.0 pour V4-Flash Max.
Ces chiffres sont utiles, mais il faut les lire avec prudence :
- les benchmarks ne reflètent pas toujours vos données réelles ;
- les modes “Max” peuvent augmenter la latence et le coût ;
- une tâche de production doit être testée avec vos prompts, vos contraintes et vos critères qualité ;
- les comparaisons avec GPT, Claude, Gemini, Qwen ou Kimi doivent être refaites régulièrement, car les versions évoluent vite.
La bonne approche consiste à créer un mini-benchmark interne : 30 à 100 cas réels, scoring humain, coût par requête, latence, taux d’erreur, robustesse sur les consignes et qualité des réponses longues.
DeepSeek V4 est-il open source ?
DeepSeek présente V4 Preview comme “open-sourced” dans son annonce, et la carte officielle Hugging Face indique que le dépôt et les poids du modèle sont sous licence MIT.
Dans un article technique, il est préférable de parler de poids ouverts ou open-weight plutôt que de promettre trop largement “open source” sans nuance. Les poids ouverts permettent de télécharger, étudier et déployer le modèle selon la licence, mais cela ne signifie pas automatiquement que tout l’environnement d’entraînement, les données exactes, l’infrastructure ou les recettes internes sont entièrement reproductibles.
Peut-on faire tourner DeepSeek V4 localement ?
Oui, les dépôts Hugging Face incluent des instructions pour l’exécution locale, avec des références à l’inférence, à vLLM, SGLang et Docker selon les variantes.
Mais « possible » ne veut pas dire « accessible sur un ordinateur grand public ». V4-Pro compte 1 600 milliards de paramètres et V4-Flash 284 milliards ; même Flash reste un modèle de très grande taille. Une exécution locale complète exige généralement une infrastructure multi-GPU, du parallélisme et un runtime compatible. Pour une équipe qui ne dispose pas de cette infrastructure, l’API officielle ou un fournisseur d’inférence est généralement plus réaliste qu’une exécution locale complète.
DeepSeek recommande également, pour le mode Think Max en local, une fenêtre de contexte d’au moins 384K tokens, ce qui confirme que les usages avancés demandent une configuration importante.
DSpark : un nouveau DeepSeek V4 ?
Non. Les variantes DeepSeek-V4-Pro-DSpark et DeepSeek-V4-Flash-DSpark ne sont pas de nouveaux modèles au sens classique. La page Hugging Face officielle précise que DSpark correspond au même checkpoint avec un module additionnel de décodage spéculatif.
Le dépôt DeepSpec de DeepSeek décrit DSpark comme une partie d’un codebase destiné à l’entraînement et à l’évaluation de modèles de brouillon pour le speculative decoding.
En clair : DSpark vise surtout à accélérer l’inférence. Il ne faut pas le présenter comme un “DeepSeek V5” ni comme une amélioration générale de la qualité du modèle.
DeepSeek V4 vs ChatGPT, Claude et Gemini
DeepSeek V4 doit être comparé à GPT, Claude ou Gemini selon l’usage, pas selon un seul classement global.
| Besoin | DeepSeek V4 peut être intéressant si… | À comparer avec prudence |
|---|---|---|
| Coût API | vous avez beaucoup de volume texte | prix réels, cache hit, latence |
| Contexte long | vous traitez de très grands documents | qualité de récupération dans le contexte |
| Code | vous utilisez agents, refactorisation, tests | taux de réussite sur votre repo |
| Données sensibles | vous pouvez déployer localement ou contrôler l’infrastructure | politiques de confidentialité et conformité |
| Multimodal | votre usage est principalement texte | DeepSeek V4 n’est pas le meilleur choix si l’image/audio/vidéo est central |
| Assistant généraliste | vous voulez un modèle économique et puissant | expérience utilisateur, fiabilité, écosystème |
Sur les benchmarks publiés par DeepSeek, V4-Pro Max se rapproche de plusieurs modèles fermés dans certaines tâches, mais ces résultats restent à contextualiser : ce sont des résultats présentés dans la carte modèle et ils ne remplacent pas un test indépendant sur vos cas d’usage.
Sécurité, confidentialité et conformité
DeepSeek V4 est attractif pour le coût et les performances, mais les questions de confidentialité doivent être prises au sérieux, surtout en entreprise.
La politique de confidentialité de DeepSeek s’applique aux services officiels — application, sites web, logiciels et services associés qui renvoient vers cette politique. Elle indique que DeepSeek peut collecter les prompts, fichiers téléversés, photos, historiques de chat, données de compte, données d’appareil, données réseau et localisation approximative, et que les données personnelles sont directement collectées, traitées et stockées en République populaire de Chine. Elle précise également que les services ne sont pas conçus pour recevoir des données personnelles sensibles et que les utilisateurs ne doivent pas en fournir.
La politique mentionne l’utilisation de certaines données pour développer et entraîner les technologies de DeepSeek, ainsi que des droits d’opposition selon la juridiction applicable. Elle ne couvre toutefois pas automatiquement les applications créées par des développeurs à partir de la plateforme ouverte : l’opérateur de l’application devient responsable de sa propre information et de ses règles de traitement. Un déploiement auto-hébergé ou un fournisseur tiers doit donc être évalué selon sa politique et son architecture propres.
Les autorités ont déjà soulevé des préoccupations réglementaires. L’autorité italienne de protection des données a ordonné en janvier 2025 la limitation du traitement des données des utilisateurs italiens. En avril 2025, la Commission sud-coréenne de protection des informations personnelles a publié les résultats de son examen et recommandé des corrections concernant notamment les transferts transfrontaliers, la transparence et l’utilisation des données saisies. Pour les données sensibles ou réglementées, privilégiez l’anonymisation, une architecture privée et une analyse juridique et technique avant production.
Checklist minimale avant production :
- vérifier la politique de confidentialité actuelle ;
- vérifier le lieu de traitement et de stockage des données ;
- tester une option d’hébergement privé ou local si les données sont sensibles ;
- anonymiser les prompts lorsque c’est possible ;
- ne pas envoyer de secrets, clés API, données médicales, données clients ou informations contractuelles confidentielles sans base légale et contrôle ;
- documenter les usages autorisés en interne ;
- prévoir une solution de fallback vers un autre modèle.
Avantages de DeepSeek V4
DeepSeek V4 a plusieurs points forts clairs :
- Très grand contexte : le support 1M ouvre des usages avancés sur documents longs, codebases et agents.
- Prix API compétitifs : V4-Flash est particulièrement intéressant pour les volumes élevés.
- Deux variantes lisibles : Flash pour l’économie, Pro pour la qualité.
- API compatible OpenAI/Anthropic : migration plus simple pour les développeurs.
- Poids ouverts sous MIT : possibilité d’expérimenter hors de l’API officielle.
- Orientation agentique : tool calls, mode Thinking et intégrations avec outils de codage.
Limites de DeepSeek V4
Les limites sont tout aussi importantes :
- Preview : le produit peut encore évoluer.
- Modèle textuel, non multimodal : les images, l’audio et la vidéo doivent être traités par un autre modèle ou un pipeline externe.
- Exécution locale exigeante : V4-Pro n’est pas adapté à une machine grand public.
- Confidentialité à vérifier : l’usage de données sensibles impose une analyse juridique et technique.
- Benchmarks à contextualiser : les scores publiés ne remplacent pas des tests internes.
- Dépréciation des anciens noms API : les intégrations utilisant
deepseek-chatoudeepseek-reasonerdoivent migrer.
Faut-il migrer vers DeepSeek V4 ?
Oui, si votre usage correspond à l’un de ces scénarios :
- vous utilisez déjà DeepSeek via API ;
- vous avez besoin d’un contexte très long ;
- vous cherchez à réduire les coûts d’inférence ;
- vous développez des agents de code ;
- vous voulez une alternative open-weight aux modèles fermés ;
- vous pouvez tester sérieusement la qualité avant production.
Non, ou pas immédiatement, si :
- vous traitez des données très sensibles sans option privée ;
- vous avez besoin de multimodal natif ;
- votre stack actuelle fonctionne déjà avec un taux d’erreur faible ;
- vous ne pouvez pas absorber les changements liés à une version Preview ;
- vous n’avez pas de benchmark interne pour mesurer la migration.
La meilleure stratégie est souvent progressive : tester V4-Flash sur les tâches simples, V4-Pro sur les tâches complexes, puis décider avec des métriques concrètes.
Méthode de test recommandée avant production
Pour comparer DeepSeek V4 avec votre modèle actuel, créez un benchmark interne simple :
| Étape | Action |
|---|---|
| 1 | Sélectionner 50 à 100 requêtes réelles |
| 2 | Séparer les tâches simples, complexes, longues et sensibles |
| 3 | Tester V4-Flash, V4-Pro et votre modèle actuel |
| 4 | Mesurer qualité, hallucinations, respect des consignes, latence et coût |
| 5 | Faire évaluer les réponses par des humains |
| 6 | Définir une règle de routage : Flash par défaut, Pro pour les tâches difficiles |
| 7 | Ajouter des garde-fous : logs, monitoring, fallback, limites de données |
Cette méthode évite de choisir un modèle uniquement sur la base d’un benchmark public.
FAQ sur DeepSeek V4
DeepSeek V4 est-il officiellement disponible ?
Oui. DeepSeek V4 Preview est annoncé officiellement, avec disponibilité via le web, l’application et l’API.
Quelle est la différence entre DeepSeek V4-Pro et V4-Flash ?
V4-Pro est le modèle le plus puissant, avec davantage de paramètres activés et un coût plus élevé. V4-Flash est plus économique et plus adapté aux usages à fort volume.
DeepSeek V4 est-il gratuit ?
L’accès web peut être proposé via l’interface DeepSeek, mais l’usage API est payant selon les tarifs officiels. Les poids ouverts sur Hugging Face peuvent être téléchargés sous licence MIT, mais l’inférence locale ou cloud entraîne des coûts matériels ou d’hébergement.
Quels sont les prix de l’API DeepSeek V4 ?
Le 10 juillet 2026, la page officielle indique pour V4-Flash : $0.0028 par million de tokens input en cache hit, $0.14 en cache miss et $0.28 par million de tokens output. Pour V4-Pro : $0.003625 en cache hit, $0.435 en cache miss et $0.87 en output.
DeepSeek V4 est-il compatible avec l’API OpenAI ?
Oui. La documentation DeepSeek indique que l’API utilise un format compatible OpenAI et Anthropic, avec les modèles deepseek-v4-flash et deepseek-v4-pro.
Que signifie le contexte 1M ?
Cela signifie que le modèle peut accepter une très grande quantité de texte dans une seule requête. C’est utile pour les longs documents, les dépôts de code, les historiques de conversation et les workflows agentiques, mais la qualité dépend toujours du prompt, de la tâche et de l’évaluation.
DeepSeek V4 est-il open source ?
Les poids et le dépôt Hugging Face sont indiqués sous licence MIT. Il est plus précis de parler de modèle open-weight, car tous les éléments nécessaires à une reproduction complète de l’entraînement ne sont pas forcément publiés.
Peut-on faire tourner DeepSeek V4 localement ?
Oui, des instructions existent, mais l’exécution locale complète exige une infrastructure importante. V4-Flash est moins lourd que V4-Pro, mais ses 284 milliards de paramètres le placent encore loin d’un modèle destiné à une machine grand public. Pour beaucoup d’équipes, l’API ou un fournisseur d’inférence reste l’option la plus réaliste.
DeepSeek V4 est-il meilleur que ChatGPT, Claude ou Gemini ?
Pas dans l’absolu. DeepSeek V4 peut être très compétitif sur le coût, le contexte long, le code et certains benchmarks, mais le meilleur choix dépend du cas d’usage, de la latence, de la confidentialité, du taux d’erreur et du budget.
DeepSeek V4 est-il adapté aux données confidentielles ?
Pas sans analyse préalable. La politique de confidentialité de DeepSeek mentionne la collecte de prompts, fichiers, historiques et données techniques, ainsi que le traitement et stockage de données personnelles en Chine. Pour des données sensibles, privilégiez l’anonymisation, un déploiement privé ou une solution avec garanties contractuelles adaptées.
Verdict
DeepSeek V4 est l’un des modèles IA les plus intéressants de 2026 pour les équipes qui cherchent un compromis entre performance, contexte long, coût API et contrôle open-weight. V4-Flash est le meilleur choix pour commencer, tester et traiter du volume. V4-Pro devient pertinent pour les tâches plus complexes : code, agents, raisonnement, analyse longue et workflows critiques.
La bonne décision n’est pas de remplacer immédiatement tous vos modèles par DeepSeek V4. La bonne décision est de le tester sur vos propres cas d’usage, de mesurer le coût réel avec cache, de vérifier la confidentialité et de construire un routage intelligent entre Flash, Pro et vos modèles existants.




