DeepSeek-VL, parfois écrit « DeepSeek VL », est la première famille vision-langage publiée par DeepSeek pour comprendre des images avec une consigne textuelle. Elle a été suivie par DeepSeek-VL2, qui améliore l’analyse de documents, tableaux, graphiques et la localisation d’objets. Ces modèles possèdent des poids téléchargeables, mais aucun identifiant DeepSeek-VL ou VL2 n’apparaît dans l’API officielle actuelle.
En bref : utilisez DeepSeek-VL ou VL2 pour un projet visuel auto-hébergé et reproductible. Pour de l’OCR documentaire spécialisé, examinez plutôt DeepSeek-OCR. Pour comprendre et générer des images dans un même modèle, Janus-Pro est une famille distincte. Ne supposez pas que l’API textuelle DeepSeek-V4 expose les mêmes fonctions.
Dernière vérification : 20 juillet 2026. deepseek-fr.ai est un guide indépendant, sans affiliation avec DeepSeek.
Statut de DeepSeek-VL en 2026
| Famille | Fonction principale | Variantes officielles | Statut |
|---|---|---|---|
| DeepSeek-VL | Compréhension image + texte | 1.3B Base/Chat et 7B Base/Chat | Première génération, poids disponibles |
| DeepSeek-VL2 | Compréhension multimodale MoE et visual grounding | Tiny, Small et VL2 | Successeur de VL, poids disponibles |
| Janus / Janus-Pro | Compréhension multimodale et génération d’images | Famille distincte | À choisir si la génération visuelle est nécessaire |
| DeepSeek-OCR / OCR 2 | Lecture et conversion de documents | Famille OCR distincte | Plus spécialisée pour les documents et le Markdown |
| DeepSeek-V4 API | Modèles courants de l’API DeepSeek | Flash et Pro | Aucun endpoint VL dédié n’est listé dans la documentation publique |
Cette page traite des poids téléchargeables, pas d’une promesse de fonction disponible sur api.deepseek.com. Au 20 juillet 2026, la liste officielle expose deepseek-v4-flash et deepseek-v4-pro, sans identifiant VL ou VL2 dédié. La liste officielle des modèles API doit être vérifiée avant chaque intégration.
Que peut faire un modèle DeepSeek-VL ?
- décrire une photographie ou une scène ;
- répondre à une question fondée sur une image ;
- transcrire du texte visible et reconnaître certaines formules ;
- interpréter un tableau, un graphique ou un diagramme ;
- analyser une capture d’écran ou une interface ;
- proposer une structure HTML ou une description à partir d’une maquette ;
- localiser visuellement un objet avec les fonctions prévues par VL2.
Ces capacités restent probabilistes. Le modèle peut omettre un chiffre, inverser deux colonnes ou décrire un objet absent. Pour une facture, un contrat, une prescription ou un document administratif, conservez l’image originale, marquez les valeurs incertaines et faites valider l’extraction.
DeepSeek-VL original : modèles 1.3B et 7B
La famille publiée en mars 2024 comprend quatre checkpoints et une longueur de séquence documentée de 4 096 tokens. « Base » désigne la fondation destinée notamment à l’adaptation ; « Chat » désigne la version réglée pour suivre une conversation image-texte.
| Checkpoint | Choix adapté | Limite pratique |
|---|---|---|
| VL-1.3B-Base | Recherche ou fine-tuning léger | Nécessite un réglage pour dialoguer efficacement |
| VL-1.3B-Chat | Prototype local et images simples | Moins robuste sur les documents très denses |
| VL-7B-Base | Adaptation avec davantage de capacité | Besoin de mémoire supérieur |
| VL-7B-Chat | Questions visuelles et documents détaillés | Déploiement plus lourd que 1.3B |
Le modèle 1.3B utilise un encodeur SigLIP-L avec une entrée documentée de 384 × 384. La branche 7B combine une vue sémantique et une branche haute résolution fondée sur SAM-B. Cette architecture aide à conserver davantage de détails, mais ne garantit pas la lecture exacte de petits caractères.
DeepSeek-VL2 : le successeur MoE
DeepSeek-VL2, publié en décembre 2024, adopte une architecture Mixture-of-Experts. Le dépôt officiel propose trois checkpoints — Tiny, Small et VL2 — avec une longueur de séquence annoncée de 4 096. La famille cible notamment les questions visuelles, l’OCR, les documents, tableaux, graphiques et le visual grounding.
| Variante VL2 | Positionnement | Matériel selon le dépôt officiel |
|---|---|---|
| Tiny | Point d’entrée de la famille | Peut fonctionner sur un seul GPU de moins de 40 Go dans la démonstration officielle |
| Small | Compromis qualité/coût | L’exemple simple peut demander environ 80 Go ; le préremplissage incrémental vise une carte 40 Go |
| VL2 | Variante la plus lourde | Demande davantage de mémoire que Small |
Ces chiffres décrivent les scripts officiels non optimisés, pas une exigence universelle. Quantification, moteur d’inférence, nombre et résolution d’images, longueur du prompt et cache modifient fortement la consommation. Ne déduisez pas la mémoire des seuls paramètres « actifs » d’un modèle MoE : les poids totaux doivent toujours être stockés ou répartis.
VL, VL2, Janus ou DeepSeek-OCR : lequel choisir ?
| Besoin | Famille à examiner | Raison |
|---|---|---|
| Prototype léger de questions sur image | VL-1.3B-Chat | Checkpoint compact et procédure simple |
| Nouvelle application de compréhension visuelle | VL2-Tiny ou Small | Successeur de VL, meilleure couverture des tâches multimodales |
| Extraction de documents vers Markdown | DeepSeek-OCR 2 | Famille spécialisée dans l’OCR documentaire |
| Comprendre et générer des images | Janus-Pro | Architecture unifiée de compréhension et génération |
| API officielle DeepSeek actuelle | V4, pour les capacités documentées | Ne pas inventer d’endpoint image absent de la référence API |
Janus-Pro n’est pas une version de VL2. Il sépare les voies d’encodage destinées à la compréhension et à la génération d’images. DeepSeek-OCR 2 n’est pas non plus un assistant visuel généraliste : son objectif est la lecture et la structuration de documents. Choisir la famille par tâche évite un déploiement plus lourd ou moins fiable que nécessaire.
Exécuter DeepSeek-VL-1.3B-Chat localement
Le chemin ci-dessous suit le dépôt officiel DeepSeek-VL. Il utilise la petite variante Chat pour une première validation. Installez le projet dans un environnement isolé et examinez ses dépendances avant toute mise en production.
git clone https://github.com/deepseek-ai/DeepSeek-VL.git
cd DeepSeek-VL
python -m venv .venv
source .venv/bin/activate
# Sous Windows PowerShell : .venv\Scripts\Activate.ps1
pip install -e .
import torch
from transformers import AutoModelForCausalLM
from deepseek_vl.models import VLChatProcessor
from deepseek_vl.utils.io import load_pil_images
MODEL_ID = "deepseek-ai/deepseek-vl-1.3b-chat"
processor = VLChatProcessor.from_pretrained(MODEL_ID)
tokenizer = processor.tokenizer
if not torch.cuda.is_available():
raise RuntimeError(
"Cet exemple suit le chemin CUDA du dépôt officiel. "
"Adaptez et testez explicitement un autre backend."
)
model = AutoModelForCausalLM.from_pretrained(
MODEL_ID,
trust_remote_code=True,
).to(torch.bfloat16).cuda().eval()
conversation = [
{
"role": "User",
"content": (
"<image_placeholder>Transcris ce justificatif en conservant "
"les nombres et les intitulés. Marque [ILLISIBLE] au lieu de deviner."
),
"images": ["./document-test.png"],
},
{"role": "Assistant", "content": ""},
]
images = load_pil_images(conversation)
inputs = processor(
conversations=conversation,
images=images,
force_batchify=True,
).to(model.device)
with torch.inference_mode():
embeddings = model.prepare_inputs_embeds(**inputs)
output_ids = model.language_model.generate(
inputs_embeds=embeddings,
attention_mask=inputs.attention_mask,
pad_token_id=tokenizer.eos_token_id,
bos_token_id=tokenizer.bos_token_id,
eos_token_id=tokenizer.eos_token_id,
max_new_tokens=512,
do_sample=False,
use_cache=True,
)
print(tokenizer.decode(output_ids[0].cpu().tolist(), skip_special_tokens=True))
trust_remote_code=True exécute du code provenant du dépôt du modèle. Auditez-le et fixez une révision approuvée. Le support BF16 dépend du GPU ; une carte incompatible exige une précision et une configuration différentes. L’exemple n’est pas une estimation de performance ni un pipeline documentaire complet.
Analyser un PDF correctement
DeepSeek-VL reçoit des images, pas un PDF arbitraire comme objet unique. Un pipeline fiable doit :
- détecter si le PDF contient déjà une couche texte exploitable ;
- rendre les pages en images à une résolution contrôlée ;
- conserver numéro, orientation et ordre des pages ;
- découper les documents longs pour respecter le contexte ;
- extraire texte, tableaux et champs avec un format explicite ;
- comparer les valeurs critiques à l’image ou à un OCR indépendant ;
- journaliser les incertitudes sans conserver inutilement de données personnelles.
Pour des formulaires français, testez accents, dates JJ/MM/AAAA, virgule décimale, IBAN, SIREN/SIRET, montants HT/TVA/TTC et tableaux multi-colonnes. Mesurez l’exactitude caractère par caractère et champ par champ ; une description visuellement plausible ne suffit pas.
Prompts adaptés à chaque tâche visuelle
Demandez au modèle de distinguer observation et interprétation. Cette séparation rend les erreurs plus faciles à détecter et limite les détails inventés.
Facture ou justificatif
Extrais uniquement les informations visibles : fournisseur, date, numéro,
montant HT, taux et montant de TVA, total TTC et devise.
Retourne un objet JSON. Pour chaque champ, ajoute `value`, `confidence`
et `evidence`. Utilise null si la valeur n’est pas lisible. Ne calcule pas
une valeur manquante et ne corrige pas silencieusement les nombres.
Graphique
Décris d’abord ce qui est directement visible : titre, axes, unités,
légende et séries. Releve ensuite les valeurs seulement lorsqu’elles sont
lisibles. Sépare enfin les tendances observées des interprétations possibles.
Signale toute échelle tronquée ou élément qui empêche une conclusion fiable.
Capture d’écran d’une application
Inventorie les composants visibles de haut en bas : navigation, champs,
boutons, messages et états. N’invente aucune action non visible.
Pour chaque problème d’accessibilité apparent, cite l’indice visuel observé
et marque « à vérifier dans le code » lorsqu’une conclusion exige le DOM.
Une demande de JSON ne garantit pas un JSON valide avec ces checkpoints historiques. Parsez la sortie, vérifiez les types et appliquez un schéma côté application. Conservez également une preuve visuelle — zone ou extrait — pour les champs importants lorsque le modèle et le pipeline le permettent.
Protocole d’évaluation avant production
- Constituez un jeu représentatif des appareils, résolutions, langues et mises en page réelles.
- Masquez ou synthétisez les données personnelles lorsque l’original n’est pas indispensable.
- Mesurez séparément transcription, extraction de champs, ordre de lecture et réponse visuelle.
- Ajoutez des images floues, tournées, incomplètes et contradictoires afin de tester le refus de deviner.
- Comparez VL-1.3B, VL2-Tiny et le modèle spécialisé OCR avec le même protocole.
- Fixez des seuils de confiance et une voie de revue humaine avant l’automatisation.
- Mesurez mémoire, latence et erreurs sur le matériel cible, pas seulement dans un notebook.
Pour l’OCR, utilisez un taux d’erreur sur les caractères et les mots. Pour les champs, mesurez précision et rappel. Pour les tableaux, vérifiez aussi lignes, colonnes et cellules fusionnées. Une moyenne globale peut masquer une erreur grave sur les montants, dates ou identifiants.
Confidentialité et sécurité
Un modèle local peut éviter l’envoi des images à un fournisseur de modèle distant, à condition que l’ensemble du pipeline reste local. Vérifiez les téléchargements, journaux, télémétrie, sauvegardes, espaces temporaires et interfaces Web. En France et dans l’Union européenne, une facture, une pièce d’identité ou un dossier médical peut contenir des données personnelles sensibles : appliquez minimisation, contrôle d’accès, chiffrement et durée de conservation documentée.
Limites techniques
- Une image redimensionnée peut perdre les petits caractères avant même l’inférence.
- Le modèle peut confondre chiffres, signes, colonnes ou légendes.
- Une réponse textuelle ne fournit pas automatiquement des coordonnées ou une structure de page fiables.
- Le français et les mises en page administratives doivent être évalués séparément des benchmarks publiés.
- Plusieurs images partagent le budget de contexte avec la consigne et la réponse.
- VL et VL2 ne génèrent pas des images ; cette fonction appartient notamment à la famille Janus.
- Les poids historiques ne reçoivent pas automatiquement les mises à jour des services DeepSeek-V4.
Licences et usage commercial
Les dépôts DeepSeek-VL et DeepSeek-VL2 placent leur code sous licence MIT. Les poids Base/Chat de VL et les poids VL2 sont soumis à la DeepSeek Model License ; les dépôts indiquent que l’usage commercial est permis sous ses conditions. Janus-Pro utilise également une licence de modèle DeepSeek, tandis que DeepSeek-OCR 2 affiche Apache 2.0 sur sa fiche officielle.
Ne résumez donc pas toute la lignée par « licence MIT » et ne supposez pas qu’une licence de poids accorde un droit sur la marque DeepSeek. Vérifiez le texte attaché au checkpoint exact avant redistribution, fine-tuning ou fourniture d’un service.
Questions fréquentes
DeepSeek-VL est-il disponible dans l’API officielle ?
Pas sous un identifiant dédié dans la liste publique actuelle. Pour VL ou VL2, téléchargez les poids officiels et déployez-les, ou utilisez un fournisseur tiers qui nomme clairement le checkpoint.
Quelle différence entre Base et Chat ?
Base vise la recherche et l’adaptation ; Chat a été réglé pour répondre directement à une conversation image-texte. Chat est généralement le choix de départ pour une application sans fine-tuning.
DeepSeek-VL peut-il générer une image ?
Non. VL et VL2 transforment une image et une consigne en texte. Janus-Pro est la famille DeepSeek conçue pour réunir compréhension multimodale et génération visuelle.
Quel modèle choisir pour convertir des scans en Markdown ?
DeepSeek-OCR 2 est plus directement spécialisé pour cet usage. Comparez-le toutefois à VL2 sur un jeu de documents français représentatif et contrôlez séparément texte, tableaux, ordre de lecture et formules.
Peut-on utiliser VL2 commercialement ?
Le dépôt officiel indique que oui sous les conditions de la DeepSeek Model License. Le code est sous MIT ; les poids relèvent d’un texte distinct qu’il faut lire avant déploiement ou redistribution.
Sources officielles
- Dépôt officiel DeepSeek-VL
- Fiche officielle DeepSeek-VL-7B-Chat sur Hugging Face
- Dépôt officiel DeepSeek-VL2
- Dépôt officiel Janus et Janus-Pro
- Dépôt officiel DeepSeek-OCR
- Fiche officielle DeepSeek-OCR 2
- Annonce officielle DeepSeek-V4 et changement de génération API
- Modèles actuellement listés dans l’API DeepSeek
Pour préparer le déploiement, consultez également notre guide exécuter DeepSeek localement et le comparatif local ou API.




