DeepSeek V4 Flash Vision Exp: API, prijzen en afbeeldingslimieten
Een praktische gids voor DeepSeek V4 Flash Vision Exp: ondersteunde afbeeldingen, API-formaten, tokenprijzen, OCR-gebruiksscenario's en de limieten en afwegingen die u eerst moet testen.

DeepSeek V4 Flash Vision Exp is het eerste V4 Flash-eindpunt van DeepSeek dat afbeeldingen naast tekst kan lezen. Het is een experimenteel beeldtaalmodel, geen beeldgenerator: u verzendt schermafbeeldingen, grafieken, documenten of foto's en ontvangt een tekstantwoord.
DeepSeek heeft het model in augustus 21, 2026 uitgebracht. De kopnummers zijn ongebruikelijk genereus voor een snel model: een 1-miljoen-token contextvenster, tot 384K-uitvoertokens, toolaanroepen, JSON-uitvoer en ondersteuning voor zowel OpenAI- als Anthropic-compatibele API's. De belangrijkste details zitten echter verborgen in de manier waarop afbeeldingen worden vergroot of verkleind, geteld en geleverd.
In deze handleiding wordt uitgelegd wat de API feitelijk accepteert, wat het kost en waar een kleine test in de echte wereld waardevoller is dan een andere benchmarktabel.
Wat DeepSeek V4 Flash Vision Exp doet
De model-ID is deepseek-v4-flash-vision-exp. Volgens de [release-aankondiging] van DeepSeek (https://api-docs.deepseek.com/news/news260821/) accepteert het gemengde tekst- en beeldinvoer en retourneert het tekst. Typische banen zijn onder meer:
- labels, tabellen en interfacetekst van schermafbeeldingen lezen;
- een diagram of diagram uitleggen;
- vergelijken van meerdere productafbeeldingen;
- het inspecteren van een visuele foutstatus voordat een tool wordt aangeroepen;
- een documentafbeelding omzetten in gestructureerde JSON;
- vragen over een foto beantwoorden.
Dat laatste punt heeft een grens nodig. Een visie-taalmodel kan beschrijven wat het ziet, maar een zelfverzekerd antwoord is niet hetzelfde als een geverifieerd antwoord. Kleine tekst, overvolle tafels, ongebruikelijke symbolen, nauwkeurige tellingen en visueel vergelijkbare objecten verdienen nog steeds een tweede controle.
Het model ondersteunt JPEG, PNG, GIF en WebP. DeepSeek detecteert de echte bestandsinhoud in plaats van de extensie of het aangegeven MIME-type te vertrouwen. Afbeeldingen kunnen inline worden verzonden als base64, worden opgehaald van een externe URL, of eenmalig worden geüpload via de Files API en later worden verwezen met een file_id.
De image-token-regel is belangrijker dan de resolutie
DeepSeek's visiedocumentatie zegt dat grote afbeeldingen worden verkleind met behoud van hun beeldverhouding totdat hun aantal pixels ongeveer vergelijkbaar is met een 800 by 800-afbeelding. Elke afbeelding is beperkt tot 384-invoertokens.
Dit maakt beeldinvoer goedkoop, maar het verklaart ook waarom een groot screenshot mogelijk geen betere OCR oplevert. Een 5,000-pixelafbeelding en een 2,000-pixelafbeelding kunnen na het wijzigen van het formaat hetzelfde aantal tokens opleveren. Meer pixels in het originele bestand garanderen niet dat de details in het model beter leesbaar zijn.
Voor compacte schermafbeeldingen snijdt u rond de relevante regio bij voordat u deze verzendt. Gebruik voor een lang dashboard meerdere doelgerichte uitsneden in plaats van één paginagrote opname. Vraag bij documentwerk eerst om een transcriptie en daarna om een gestructureerde interpretatie. Dat onderscheidt een leesfout van een redeneerfout.
De huidige API staat maximaal 600-afbeeldingen in één verzoek toe, maar die limiet mag niet worden verward met een aanbevolen batchgrootte. Grote batches maken het moeilijker om te identificeren welke afbeelding een onjuist antwoord heeft veroorzaakt, en de totale aanvraag heeft afzonderlijke limieten voor de bytegrootte. Begin met de kleinste set die de vraag kan beantwoorden.
API-formaat en een minimaal verzoek
DeepSeek maakt gebruik van het bekende OpenAI chatformaat. Een afbeelding en een vraag bevinden zich in hetzelfde gebruikersbericht als inhoudsblokken:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": {"url": "https://example.com/chart.png"},
},
{
"type": "text",
"text": "List the three largest changes and cite the labels you read.",
},
],
}],
)
print(response.choices[0].message.content)
Externe URL's zijn handig voor openbare middelen. Base64 is handig voor een afbeelding die al in het geheugen zit, maar vergroot de hoofdtekst van het verzoek. Een file_id is meestal de schonere keuze wanneer hetzelfde screenshot of document in meerdere verzoeken wordt gebruikt.
Afbeeldingen worden alleen geaccepteerd in gebruikersberichten. Als u een afbeelding in een systeem- of assistentbericht plaatst, wordt er een fout weergegeven. DeepSeek beperkt ook de externe URL-lengte tot 8,192-tekens, een enkele URL/base64-afbeelding op 32 MiB en een Files API-afbeelding op 64 MiB.
DeepSeek V4 Flash Vision Exp-prijzen
DeepSeek factureert afbeeldingstokens samen met tekstinvoertokens. Op de officiële prijspagina gebruikt het experimentele visie-eindpunt dezelfde V4-flitssnelheden:
| Tokentype | Buiten de spits | Piek |
|---|---|---|
| Gecachte invoer | $0.007 / 1M | $0.014 / 1M |
| Niet-gecachte invoer | $0.22 / 1M | $0.44 / 1M |
| Uitvoer | $0.66 / 1M | $1.32 / 1M |
DeepSeek definieert piekperioden als 01:00–04:00 en 06:00–10:00 UTC, van maandag tot en met vrijdag. Op alle overige uren wordt het daltarief gehanteerd. Prijzen en tijdvensters kunnen veranderen, dus controleer de prijspagina voordat u een test omzet in een geplande productietaak.
Omdat elk beeld het hoogste punt bereikt bij de invoertokens 384, is het beeldgedeelte alleen al klein bij de huidige snelheid. De uitvoerlengte, herhaalde niet-gecachte context en het aantal oproepen zijn doorgaans belangrijker. Een workflow die om een beknopt JSON-object vraagt, kan veel minder kosten dan een workflow die bij elke afbeelding een lang verhaal uitnodigt.
Een verstandige evaluatiechecklist
Begin niet met een gepolijst demobeeld. Gebruik het materiaal dat normaal gesproken uw workflow onderbreekt.
- Kies representatieve afbeeldingen van 20 tot 50, inclusief wazige, brede, donkere en tekstrijke voorbeelden.
- Definieer een antwoordformaat dat mechanisch kan worden gecontroleerd.
- Registreer ontbrekende velden en onjuiste velden afzonderlijk.
- Herhaal een paar identieke verzoeken om de consistentie te meten.
- Vergelijk uitsneden met volledige afbeeldingen voor taken met fijne tekst.
- Testtool roept alleen op nadat de visuele extractie zelf betrouwbaar is.
Voor OCR berekent u de veldnauwkeurigheid in plaats van te vragen of de uitvoer ‘er goed uitziet’. Voeg voor het lezen van grafieken grafieken toe met misleidende schalen en sluitwaarden. Voor interfaceagenten: controleer de coördinaten of elementbeschrijvingen voordat u een actie met consequenties toestaat.
Visieanalyse is geen beeld-naar-prompt-reconstructie
DeepSeek V4 Flash Vision Exp kan een afbeelding beschrijven en redeneren over de inhoud ervan. Het reconstrueren van een bruikbare generatieprompt is een beperktere creatieve taak: het vereist beslissingen over compositie, belichting, lenstaal, materialen, stijl en welke details moeten worden weggelaten.
Als dat uw doel is, probeer dan de gratis Image to Prompt Generator van Yix . Het is een afzonderlijke workflow die is ontworpen om een referentieafbeelding om te zetten in een bewerkbare prompt voor het genereren van afbeeldingen. Vervolgens kunt u de opties vergelijken in de Yix-modeldirectory. Het eindpunt van DeepSeek is momenteel geen selecteerbaar generatiemodel op Yix.
Is het de moeite waard om te gebruiken?
DeepSeek V4 Flash Vision Exp is het meest overtuigend wanneer het begrijpen van afbeeldingen een stap is in een grotere, tool-gebruikende workflow. Het lage plafond voor afbeeldingstekens maakt experimenteren goedkoop, de compatibele API's verminderen het integratiewerk en het lange contextvenster laat ruimte voor instructies en ondersteunende documenten.
De afweging zit precies in de naam: Exp betekent experimenteel. Het formaatwijzigingsgedrag vormt ook een praktisch plafond voor fijne visuele details. Beschouw het als een veelbelovend, goedkoop onderdeel en niet als een automatische vervanging van een speciale OCR-engine of een geteste documentpijplijn.
Begin met gewassen, eis gestructureerde antwoorden, meet echte fouten en reserveer een reserve voor kritieke velden. Dat zal je meer vertellen dan welke score dan ook.
Gerelateerde handleidingen voor snelle modellen
Voor een ander multimodaal model met een 1M-contextvenster vergelijkt u Qwen3.8 Flash met Flash-Next. Om het kortstondige stealth-model te begrijpen dat een open release werd, leest u de Ox Alpha en GLM-5.3-Flash-gids.
Bronnen: DeepSeek releaseaankondiging, DeepSeek visiegids en DeepSeek-prijzen.
DeepSeek is een handelsmerk van de respectieve eigenaar. Yix is niet aangesloten bij DeepSeek.