Au 29 août 2026, la documentation de l’API DeepSeek présente deux identifiants de modèle actuels : deepseek-v4-flash et deepseek-v4-pro. La facturation repose sur les tokens d’entrée et de sortie, avec un prix d’entrée fortement réduit lorsque le contexte est retrouvé dans le cache. Cette page présente les tarifs officiels en dollars américains, puis montre comment calculer un coût réaliste sans confondre l’API et le service de chat.
Guide indépendant : deepseek-fr.ai n’est ni le site officiel de DeepSeek ni un partenaire, représentant ou service approuvé par DeepSeek. Les chiffres ci-dessous ont été vérifiés dans la documentation officielle le 29 août 2026. Les prix pouvant évoluer, contrôlez toujours la page officielle Models & Pricing avant une mise en production ou une recharge importante.
Tarifs officiels de l’API DeepSeek
Tous les prix du tableau sont indiqués par million de tokens. Le point sert de séparateur décimal, conformément à l’affichage officiel. Le contexte maximal et la sortie maximale sont des limites techniques, pas des volumes facturés d’office : vous payez les tokens réellement traités et générés.
| Caractéristique | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| Version du modèle | DeepSeek-V4-Flash | DeepSeek-V4-Pro |
| Entrée — cache hit | $0.007 hors pointe · $0.014 en pointe / 1 M tokens | $0.022 hors pointe · $0.044 en pointe / 1 M tokens |
| Entrée — cache miss | $0.22 hors pointe · $0.44 en pointe / 1 M tokens | $0.66 hors pointe · $1.32 en pointe / 1 M tokens |
| Sortie | $0.66 hors pointe · $1.32 en pointe / 1 M tokens | $1.98 hors pointe · $3.96 en pointe / 1 M tokens |
| Fenêtre de contexte maximale | 1 M de tokens | 1 M de tokens |
| Sortie maximale en Chat Completions | 384 K tokens | 384 K tokens |
| Modes | Avec ou sans réflexion ; réflexion activée par défaut | Avec ou sans réflexion ; réflexion activée par défaut |
| Limite de concurrence standard | 2 500 connexions par compte | 500 connexions par compte |
Heures de pointe et heures creuses. DeepSeek applique deux tarifs pour un même modèle. Les heures de pointe couvrent 01h00–04h00 et 06h00–10h00 UTC, du lundi au vendredi ; tout le reste du temps, y compris le week-end entier, relève du tarif hors pointe, qui vaut exactement la moitié. Le tarif appliqué dépend de l’heure à laquelle la requête aboutit, et non de l’heure à laquelle elle a été envoyée. Décaler un traitement par lots vers les heures creuses divise donc la facture par deux, sans changer une ligne de code.
Pour comparer les capacités au-delà du prix, consultez notre page consacrée à DeepSeek V4 Flash et V4 Pro. Pour lancer un premier appel, suivez le guide de l’API DeepSeek en français.
Quels identifiants de modèle utiliser aujourd’hui ?
Utilisez uniquement deepseek-v4-flash ou deepseek-v4-pro dans un nouveau projet. L’annonce officielle de DeepSeek V4 précise que les anciens alias deepseek-chat et deepseek-reasoner devaient être entièrement retirés et inaccessibles après le 24 juillet 2026 à 15:59 UTC. Cette échéance étant passée, ils ne doivent plus figurer dans un exemple actuel ni dans une configuration de production.
Il existe encore une incohérence rédactionnelle dans certaines pages du Quick Start officiel : une note y parle au futur de la dépréciation du 24 juillet. En revanche, l’annonce V4 donne explicitement l’heure du retrait et l’exemple actuel de la référence GET /models ne présente que les deux identifiants V4. Cette page retient donc les identifiants V4 explicites et actuels, sans prolonger artificiellement la compatibilité des anciens alias.
deepseek-v4-flash
deepseek-v4-pro
Comment calculer le prix d’un appel DeepSeek ?
Un appel peut contenir trois catégories facturables : les tokens d’entrée trouvés dans le cache, les tokens d’entrée non trouvés dans le cache et les tokens de sortie. Le calcul doit séparer ces catégories, car leurs tarifs diffèrent.
Coût total =
(tokens d’entrée cache hit / 1 000 000 × tarif cache hit)
+ (tokens d’entrée cache miss / 1 000 000 × tarif cache miss)
+ (tokens de sortie / 1 000 000 × tarif de sortie)
Les tokens de raisonnement ne constituent pas une quatrième ligne de prix. Dans la réponse de l’API, reasoning_tokens apparaît dans completion_tokens_details : il s’agit donc d’un détail des tokens de complétion. Ils sont inclus dans les completion_tokens facturés au tarif de sortie.
Exemple 1 — V4 Flash sans cache
Supposons un appel comportant 1 000 000 de tokens d’entrée en cache miss et 200 000 tokens de sortie. Le même appel coûte deux fois plus cher s’il aboutit pendant les heures de pointe :
Tarif hors pointe
Entrée : 1 × $0.22 = $0.22
Sortie : 0.2 × $0.66 = $0.132
Total : $0.22 + $0.132 = $0.352
Tarif de pointe (le double)
Total : $0.44 + $0.264 = $0.704
Le coût exact de cet exemple est donc de $0.352 hors pointe, ou $0.704 en heures de pointe.
Exemple 2 — 80 % de l’entrée retrouvée dans le cache
Pour 800 000 tokens d’entrée en cache hit, 200 000 en cache miss et 100 000 tokens de sortie, les deux modèles coûtent, au tarif hors pointe (doublez pour les heures de pointe) :
| Modèle | Calcul | Total |
|---|---|---|
| V4 Flash | (0.8 × 0.007) + (0.2 × 0.22) + (0.1 × 0.66) | $0.1156 |
| V4 Pro | (0.8 × 0.022) + (0.2 × 0.66) + (0.1 × 1.98) | $0.3476 |
Le cache ne réduit que le prix des tokens d’entrée correspondants. Il ne diminue ni le nombre de tokens de sortie ni leur tarif.
Exemple 3 — estimation mensuelle
Un service effectue 10 000 appels par mois. Chaque appel utilise en moyenne 5 000 tokens d’entrée, tous en cache miss, et 1 000 tokens de sortie. Le volume mensuel est donc de 50 millions de tokens d’entrée et 10 millions de tokens de sortie.
| Modèle | Entrée | Sortie | Total mensuel estimé |
|---|---|---|---|
| V4 Flash | 50 × $0.22 = $11.00 | 10 × $0.66 = $6.60 | $17.60 |
| V4 Pro | 50 × $0.66 = $33.00 | 10 × $1.98 = $19.80 | $52.80 |
Ce scénario est une estimation arithmétique, pas une promesse de facture. Votre coût réel dépend du nombre de tokens renvoyé dans usage, du taux de cache effectivement obtenu et du modèle appelé.
Un token n’est pas toujours un mot
Le token est l’unité de texte reconnue par le modèle et utilisée pour la facturation. Il peut correspondre à un mot, une partie de mot, un nombre ou un signe de ponctuation. La documentation fournit une approximation pour les caractères anglais et chinois, mais elle ne publie pas de ratio fixe propre au français. Une estimation « un mot égale un token » serait donc trompeuse.
Pour une mesure fiable, utilisez les champs de la réponse : prompt_tokens, completion_tokens et total_tokens. Le champ prompt_tokens est égal à la somme de prompt_cache_hit_tokens et prompt_cache_miss_tokens. Ces valeurs observées doivent alimenter votre suivi de coût.
Comment le cache de contexte réduit-il le coût ?
Le cache de contexte sur disque est activé par défaut pour les utilisateurs de l’API. Lorsqu’une nouvelle requête réutilise intégralement un préfixe déjà mis en cache, les tokens correspondants peuvent être comptés comme cache hit et bénéficier du tarif réduit. Aucun changement de code n’est requis pour activer la fonction, mais la structure des messages influence le taux de succès.
- Placez les instructions stables, règles et longs documents communs au début de la requête.
- Évitez de modifier inutilement les premiers caractères d’un préfixe réutilisé.
- Contrôlez les champs
prompt_cache_hit_tokensetprompt_cache_miss_tokensau lieu de supposer qu’un cache hit a eu lieu. - Ne construisez pas un budget sur un taux de cache garanti : DeepSeek décrit le mécanisme comme « best effort ».
La construction du cache peut prendre quelques secondes. Les entrées inutilisées sont généralement supprimées après quelques heures à quelques jours. Retrouvez les règles détaillées et des exemples dans notre guide du cache de contexte DeepSeek.
V4 Flash ou V4 Pro : quel modèle coûte le moins cher pour votre usage ?
V4 Flash est le choix le moins cher sur chacune des trois lignes de facturation et dispose d’une limite de concurrence standard plus élevée. V4 Pro est le modèle plus grand et vise les tâches où un niveau de capacité supérieur peut justifier un coût accru. Le choix rationnel ne repose toutefois pas uniquement sur le prix d’un million de tokens : il faut comparer la qualité obtenue, la longueur des réponses et le nombre de relances nécessaires sur votre propre jeu de tests.
| Besoin à tester | Point de départ raisonnable | Décision à mesurer |
|---|---|---|
| Grand volume, latence et budget prioritaires | V4 Flash | Qualité suffisante et taux de correction |
| Raisonnement, code ou agent complexe | V4 Pro | Gain de qualité par rapport au surcoût |
| Routage de tâches variées | Flash par défaut, Pro pour les cas difficiles | Critères de routage et coût total |
Le chat DeepSeek et l’API sont deux services à distinguer
Les tarifs de cette page concernent les appels programmatiques à l’API DeepSeek. Ils ne définissent pas le prix, les limites ou les conditions d’accès de l’interface chat.deepseek.com. N’utilisez donc pas le calcul au token pour annoncer le coût du chat grand public, et ne supposez pas qu’un accès au chat inclut un crédit API.
La page officielle de tarification consultée ne promet pas de quota API gratuit universel. L’API de solde peut afficher un granted_balance, mais l’existence de ce champ ne garantit ni l’attribution d’un crédit ni un montant donné. Vérifiez ce qui est réellement disponible sur votre propre compte.
Solde, recharge et déduction des frais
Selon les règles officielles, le coût correspond au nombre de tokens multiplié par le tarif applicable. Les frais sont déduits du solde rechargé ou du solde accordé ; si les deux existent, le solde accordé est utilisé en priorité. Les conditions de la plateforme indiquent aussi qu’un prépaiement peut être demandé et qu’un solde insuffisant peut entraîner la suspension ou l’arrêt du service payant.
Le point de terminaison GET https://api.deepseek.com/user/balance permet de consulter la disponibilité et le détail du solde. La réponse officielle prévoit notamment total_balance, granted_balance et topped_up_balance, avec une devise en CNY ou USD.
curl "https://api.deepseek.com/user/balance" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY"
Les prix peuvent être ajustés par DeepSeek. Rechargez en fonction de l’usage prévu, conservez la date et la source de vos hypothèses budgétaires et consultez la tarification officielle régulièrement. Les éventuels impôts, frais de paiement ou conversions monétaires ne sont pas détaillés dans le tableau public : ne les inventez pas dans un devis.
La concurrence n’est pas un quota de requêtes par minute
La limite standard est de 2 500 connexions concurrentes pour V4 Flash et 500 pour V4 Pro. Une requête compte comme connexion active depuis son envoi jusqu’à la fin de la réponse. Le calcul est effectué au niveau du compte, quel que soit le nombre de clés API. Si la limite est dépassée, l’API renvoie un code HTTP 429.
Ces nombres ne signifient ni 2 500 ni 500 requêtes par minute. Ils décrivent des requêtes simultanément ouvertes. Pour le traitement des erreurs, l’isolation par user_id et les possibilités de demande d’extension, consultez notre guide des limites de l’API DeepSeek.
Huit moyens de maîtriser le coût de l’API DeepSeek
- Mesurez les tokens réels. Enregistrez les champs
usagepar modèle, fonctionnalité et client. - Commencez par V4 Flash. Faites monter une tâche vers V4 Pro uniquement si vos évaluations montrent un gain utile.
- Stabilisez les préfixes. Une structure constante peut augmenter les tokens d’entrée éligibles au cache.
- Fixez une sortie maximale adaptée. Un plafond raisonnable évite les réponses inutilement longues ; ne choisissez pas 384 K par défaut.
- Utilisez la réflexion à bon escient. Le mode réflexion est activé par défaut. Pour une tâche simple, testez le mode sans réflexion ; les tokens de raisonnement sont inclus dans les tokens de sortie facturés.
- Réduisez l’historique inutile. Ne renvoyez que le contexte nécessaire à la qualité de la réponse, en préservant les éléments requis par votre flux.
- Suivez le solde. Interrogez l’endpoint de balance et ajoutez vos propres alertes avant un seuil critique.
- Évaluez le coût par résultat. Comparez le prix d’une réponse utilisable, et pas seulement le prix brut d’un appel.
Si vous débutez, commencez par notre guide pour obtenir une clé API DeepSeek, puis appliquez un plafond de dépense dans votre propre infrastructure de suivi.
Prix bas ne signifie pas absence d’enjeu de confidentialité
La politique officielle indique que DeepSeek peut collecter les saisies, fichiers et historiques fournis au service, utiliser des données pour développer et améliorer ses technologies, et traiter ou stocker les données personnelles en République populaire de Chine. Elle déconseille aussi l’envoi de données personnelles sensibles. Évitez donc de transmettre des secrets, clés, dossiers médicaux ou données personnelles non nécessaires dans les prompts.
Si vous construisez une application avec l’Open Platform, la politique de DeepSeek précise que le traitement des données collectées auprès de vos utilisateurs finaux par votre application n’est pas couvert par sa seule politique : l’exploitant de l’application doit fournir sa propre information sur la protection des données et disposer d’une base juridique appropriée. Ce paragraphe est une synthèse informative, pas un avis juridique.
FAQ sur le prix de DeepSeek
Quel est le prix de DeepSeek V4 Flash ?
Pour l’API, V4 Flash coûte en heures creuses, V4 Flash coûte $0.007 par million de tokens d’entrée en cache hit, $0.22 en cache miss et $0.66 par million de tokens de sortie. En heures de pointe (01h00–04h00 et 06h00–10h00 UTC, du lundi au vendredi), ces montants doublent : $0.014, $0.44 et $1.32. Tarif vérifié le 29 août 2026.
Quel est le prix de DeepSeek V4 Pro ?
V4 Pro coûte $0.022 par million de tokens d’entrée en cache hit, $0.66 en cache miss et $1.98 par million de tokens de sortie en heures creuses. En heures de pointe, ces montants doublent : $0.044, $1.32 et $3.96. Tarif vérifié le 29 août 2026.
L’API DeepSeek est-elle gratuite ?
La documentation officielle consultée publie une tarification à l’usage et ne garantit pas de quota gratuit universel. Un éventuel solde accordé dépend de ce qui apparaît réellement sur votre compte ; ne le considérez pas comme un droit permanent.
Les tokens de raisonnement sont-ils facturés ?
Oui. Le schéma officiel les présente dans completion_tokens_details.reasoning_tokens, à l’intérieur des tokens de complétion. Ils font donc partie des tokens de sortie facturés.
Un million de tokens de contexte coûte-t-il automatiquement le prix d’un million de tokens ?
Non. Un million de tokens est la capacité maximale de contexte annoncée pour les deux modèles. La facture dépend du nombre de tokens effectivement envoyé, ventilé entre cache hit et cache miss, puis du nombre de tokens généré.
La sortie maximale de 384 K est-elle garantie ?
Non. Il s’agit du maximum technique annoncé pour Chat Completions, pas d’une longueur garantie pour chaque réponse. La génération peut se terminer plus tôt et vous devez fixer une limite adaptée à votre besoin.
Le cache hit est-il garanti ?
Non. DeepSeek décrit son cache comme un mécanisme « best effort ». Vérifiez la ventilation renvoyée dans usage pour connaître le nombre réel de tokens en cache hit et en cache miss.
Peut-on encore utiliser deepseek-chat ou deepseek-reasoner ?
Ne les utilisez pas dans une intégration actuelle. DeepSeek a annoncé leur retrait complet après le 24 juillet 2026 à 15:59 UTC. Remplacez-les par deepseek-v4-flash ou deepseek-v4-pro et choisissez explicitement le mode avec ou sans réflexion.
Les prix officiels sont-ils disponibles en euros ?
Le tableau officiel consulté est libellé en dollars américains. Une conversion en euros dépend du taux de change et, éventuellement, des frais de paiement ou taxes applicables ; vérifiez le montant affiché lors de votre recharge.
Sources officielles vérifiées
- DeepSeek API Docs — Models & Pricing : modèles, contexte, sortie maximale, prix et règles de déduction.
- DeepSeek V4 Preview Release : identifiants V4 et échéance de retrait complet des anciens alias.
- DeepSeek API Reference — GET /models : exemple actuel des modèles disponibles.
- DeepSeek API Docs — Token & Token Usage : définition et mesure des tokens.
- DeepSeek API Docs — Context Caching : activation, règles de hit et champs de suivi.
- DeepSeek API Docs — Rate Limit & Isolation : concurrence au niveau du compte et erreur 429.
- DeepSeek API Reference — Get User Balance : détail du solde disponible.
- DeepSeek API Reference — Create Chat Completion : champs de consommation et détail des tokens de raisonnement.
- DeepSeek Open Platform Terms of Service : paiement, ajustement des prix et responsabilités du développeur.
- DeepSeek Privacy Policy : collecte, usages, stockage et droits relatifs aux données.
Dernière vérification éditoriale : 29 août 2026. Cette date ne transforme pas les tarifs en engagement futur ; la source officielle reste prioritaire en cas de modification.
