Yix
Retour aux guides

DeepSeek V4 Flash Vision Exp : API, tarifs et limites des images

Un guide pratique de DeepSeek V4 Flash Vision Exp : images prises en charge, formats d'API, tarification des jetons, cas d'utilisation de l'OCR, ainsi que limites et compromis à tester en premier.

Dernière mise à jour: 27 août 2026Yix TeamYix Team
DeepSeek V4 Flash Vision Exp : API, tarifs et limites des images

DeepSeek V4 Flash Vision Exp est le premier point de terminaison Flash V4 de DeepSeek capable de lire des images à côté du texte. Il s'agit d'un modèle expérimental de langage de vision, pas d'un générateur d'images : vous envoyez des captures d'écran, des graphiques, des documents ou des photographies et recevez une réponse textuelle.

DeepSeek a publié le modèle en août 21, 2026. Les numéros de titre sont inhabituellement généreux pour un modèle rapide : une fenêtre de contexte de 1 million de jetons, jusqu'à des jetons de sortie 384K, des appels d'outils, une sortie JSON et une prise en charge des API compatibles OpenAI et Anthropic. Les détails les plus importants, cependant, sont cachés dans la manière dont les images sont redimensionnées, comptées et fournies.

Ce guide explique ce que l'API accepte réellement, ce qu'elle coûte et pourquoi un petit test réel est plus précieux qu'un autre tableau de référence.

Que fait DeepSeek V4 Flash Vision Exp

L'ID du modèle est deepseek-v4-flash-vision-exp. Selon [annonce de sortie] de DeepSeek (https://api-docs.deepseek.com/news/news260821/), il accepte une saisie mixte de texte et d'image et renvoie du texte. Les emplois typiques comprennent :

  • lire des étiquettes, des tableaux et du texte d'interface à partir de captures d'écran ;
  • expliquer un tableau ou un diagramme ;
  • comparer plusieurs images de produits ;
  • inspecter un état d'erreur visuel avant d'appeler un outil ;
  • transformer une image de document en JSON structuré ;
  • répondre à des questions sur une photographie.

Ce dernier point a besoin d’une frontière. Un modèle de langage vision peut décrire ce qu’il voit, mais une réponse sûre n’est pas la même chose qu’une réponse vérifiée. Les petits textes, les tableaux bondés, les symboles inhabituels, les décomptes précis et les objets visuellement similaires méritent encore une seconde vérification.

Le modèle prend en charge JPEG, PNG, GIF et WebP. DeepSeek détecte le contenu réel du fichier plutôt que de faire confiance à l'extension ou au type MIME déclaré. Les images peuvent être envoyées en ligne sous le nom base64, récupérées à partir d'une URL externe ou téléchargées une fois via l'API Files et référencées ultérieurement avec un file_id.

La règle du jeton d'image compte plus que la résolution

La [documentation de vision] de DeepSeek (https://api-docs.deepseek.com/guides/vision/) indique que les grandes images sont réduites tout en préservant leur rapport hauteur/largeur jusqu'à ce que leur nombre de pixels soit à peu près comparable à une image 800 par 800. Chaque image est limitée aux jetons d'entrée 384.

Cela rend la saisie d'images bon marché, mais cela explique également pourquoi une grande capture d'écran peut ne pas produire un meilleur OCR. Une image de pixels 5,000 et une image de pixels 2,000 peuvent se retrouver avec le même nombre de jetons après le redimensionnement. Un plus grand nombre de pixels dans le fichier d'origine ne garantit pas des détails plus lisibles à l'intérieur du modèle.

Pour des captures d'écran denses, recadrez autour de la région concernée avant de l'envoyer. Pour un long tableau de bord, utilisez plusieurs recadrages ciblés au lieu d'une seule capture d'une page entière. Pour un travail documentaire, demandez d’abord une transcription et ensuite une interprétation structurée. Cela sépare une erreur de lecture d’une erreur de raisonnement.

L'API actuelle autorise jusqu'à 600 images dans une seule requête, mais cette limite ne doit pas être confondue avec une taille de lot recommandée. Les lots volumineux rendent plus difficile l'identification de l'image à l'origine d'une réponse incorrecte, et la requête totale est soumise à des limites de taille d'octet distinctes. Commencez par le plus petit ensemble pouvant répondre à la question.

Format API et requête minimale

DeepSeek utilise le format de discussion familier OpenAI. Une image et une question vivent dans le même message utilisateur en tant que blocs de contenu :

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {
                "type": "image_url",
                "image_url": {"url": "https://example.com/chart.png"},
            },
            {
                "type": "text",
                "text": "List the three largest changes and cite the labels you read.",
            },
        ],
    }],
)

print(response.choices[0].message.content)

Les URL externes sont pratiques pour les actifs publics. Base64 est utile pour une image déjà en mémoire, mais il agrandit le corps de la requête. Un file_id est généralement le choix le plus propre lorsque la même capture d'écran ou le même document sera utilisé dans plusieurs requêtes.

Les images sont acceptées uniquement dans les messages des utilisateurs. Mettre une image dans un message système ou assistant renvoie une erreur. DeepSeek limite également la longueur de l'URL externe aux caractères 8,192, une seule image URL/base64 à 32 MiB et une image API de fichiers à 64 MiB.

Tarifs DeepSeek V4 Flash Vision Exp

DeepSeek facture les jetons d'image avec les jetons de saisie de texte. Sur la page de tarification officielle, le point de terminaison de vision expérimental utilise les mêmes fréquences de flash V4 :

Type de jetonHors pointePic
Entrée en cache$0.007 / 1M$0.014 / 1M
Entrée non mise en cache$0.22 / 1M$0.44 / 1M
Sortie$0.66 / 1M$1.32 / 1M

DeepSeek définit les périodes de pointe comme 01:00–04:00 et 06:00–10:00 UTC, du lundi au vendredi. Toutes les autres heures utilisent le tarif heures creuses. Les prix et les plages horaires peuvent changer, alors consultez la page de tarification avant de transformer un test en travail de production planifié.

Étant donné que chaque image atteint le maximum de jetons d'entrée 384, la partie de l'image à elle seule est minuscule aux tarifs actuels. La longueur de sortie, le contexte répété non mis en cache et le nombre d'appels auront généralement plus d'importance. Un flux de travail qui demande un objet JSON concis peut coûter beaucoup moins cher qu'un flux qui invite à un long récit sur chaque image.

Une liste de contrôle d’évaluation judicieuse

Ne commencez pas avec une image de démonstration soignée. Utilisez le matériel qui interrompt normalement votre flux de travail.

  1. Choisissez des images représentatives de 20 à 50, y compris des exemples flous, larges, sombres et contenant beaucoup de texte.
  2. Définissez un format de réponse vérifiable mécaniquement.
  3. Enregistrez séparément les champs manquants et les champs incorrects.
  4. Répétez quelques requêtes identiques pour mesurer la cohérence.
  5. Comparez les recadrages avec des images complètes pour les tâches de texte fin.
  6. L'outil de test n'appelle qu'une fois que l'extraction visuelle elle-même est fiable.

Pour l'OCR, calculez la précision du champ plutôt que de demander si le résultat « semble correct ». Pour la lecture des graphiques, incluez des graphiques avec des échelles et des valeurs proches trompeuses. Pour les agents d'interface, vérifiez les coordonnées ou les descriptions des éléments avant d'autoriser une action ayant des conséquences.

L'analyse de la vision n'est pas une reconstruction image-invite

DeepSeek V4 Flash Vision Exp peut décrire une image et expliquer son contenu. Reconstruire une invite de génération utile est une tâche créative plus restreinte : elle nécessite des décisions concernant la composition, l'éclairage, le langage de l'objectif, les matériaux, le style et les détails à omettre.

Si tel est votre objectif, essayez le Générateur d'image à invite gratuit de Yix . Il s'agit d'un flux de travail distinct conçu pour transformer une image de référence en une invite modifiable pour la génération d'images. Vous pouvez ensuite comparer les options dans le répertoire des modèles Yix. Le point de terminaison de DeepSeek n'est actuellement pas un modèle de génération sélectionnable sur Yix.

Est-ce que ça vaut la peine d'être utilisé ?

DeepSeek V4 Flash Vision Exp est particulièrement intéressant lorsque la compréhension de l'image n'est qu'une étape dans un flux de travail plus vaste utilisant des outils. Le faible plafond de jetons d'image rend l'expérimentation peu coûteuse, les API compatibles réduisent le travail d'intégration et la longue fenêtre contextuelle laisse de la place aux instructions et aux documents justificatifs.

Le compromis se trouve dans le nom : Exp signifie expérimental. Le comportement de redimensionnement fixe également un plafond pratique aux détails visuels fins. Considérez-le comme un composant prometteur et peu coûteux, et non comme un remplacement automatique d'un moteur OCR dédié ou d'un pipeline de documents testé.

Commencez par les cultures, exigez des réponses structurées, mesurez les erreurs réelles et gardez une réserve pour les champs critiques. Cela vous en dira plus que n’importe quel score du classement.

Guides de modèles rapides associés

Pour un autre modèle multimodal avec une fenêtre contextuelle 1M, comparez Qwen3.8 Flash avec Flash-Next. Pour comprendre le modèle furtif de courte durée qui est devenu une version ouverte, lisez le guide Ox Alpha et GLM-5.3-Flash.

Sources : Annonce de sortie de DeepSeek, Guide de vision DeepSeek et Tarifs DeepSeek.

DeepSeek est une marque commerciale de son propriétaire respectif. Yix n'est pas affilié à DeepSeek.