DeepSeek V4 Flash Vision Exp: API, Preise und Bildlimits
Ein praktischer Leitfaden für DeepSeek V4 Flash Vision Exp: unterstützte Bilder, API-Formate, Token-Preise, OCR-Anwendungsfälle sowie die Grenzen und Kompromisse, die es zuerst zu testen gilt.

DeepSeek V4 Flash Vision Exp ist der erste V4 Flash-Endpunkt von DeepSeek, der neben Text auch Bilder lesen kann. Es handelt sich um ein experimentelles Vision-Sprachmodell, nicht um einen Bildgenerator: Sie senden Screenshots, Diagramme, Dokumente oder Fotos und erhalten eine Textantwort.
DeepSeek veröffentlichte das Modell im August 21, 2026. Die Schlagzeilen sind für ein schnelles Modell ungewöhnlich großzügig: ein 1-Millionen-Token-Kontextfenster, bis zu 384K-Ausgabetokens, Toolaufrufe, JSON-Ausgabe und Unterstützung sowohl für OpenAI- als auch für Anthropic-kompatible APIs. Die wichtigeren Details verbergen sich jedoch darin, wie Bilder in der Größe geändert, gezählt und bereitgestellt werden.
Dieser Leitfaden erklärt, was die API tatsächlich akzeptiert, was sie kostet und wo ein kleiner Test in der Praxis wertvoller ist als eine andere Benchmark-Tabelle.
Was DeepSeek V4 Flash Vision Exp macht
Die Modell-ID lautet deepseek-v4-flash-vision-exp. Laut der Veröffentlichungsankündigung von DeepSeek akzeptiert es gemischte Text- und Bildeingaben und gibt Text zurück. Typische Jobs sind:
- Lesen von Beschriftungen, Tabellen und Schnittstellentexten aus Screenshots;
- ein Diagramm oder Diagramm erklären;
- Vergleich mehrerer Produktbilder;
- Überprüfen eines visuellen Fehlerstatus vor dem Aufrufen eines Tools;
- Ein Dokumentbild in strukturiertes JSON umwandeln;
- Beantwortung von Fragen zu einem Foto.
Dieser letzte Punkt braucht eine Grenze. Ein Vision-Sprachmodell kann beschreiben, was es sieht, aber eine sichere Antwort ist nicht dasselbe wie eine verifizierte Antwort. Kleiner Text, überfüllte Tabellen, ungewöhnliche Symbole, genaue Zählungen und optisch ähnliche Objekte verdienen dennoch eine zweite Überprüfung.
Das Modell unterstützt JPEG, PNG, GIF und WebP. DeepSeek erkennt den tatsächlichen Dateiinhalt, anstatt der Erweiterung oder dem deklarierten MIME-Typ zu vertrauen. Bilder können inline als base64 gesendet, von einer externen URL abgerufen oder einmal über die Datei-API hochgeladen und später mit einem file_id referenziert werden.
Die Bild-Token-Regel ist wichtiger als die Auflösung
In der Vision-Dokumentation von DeepSeek heißt es, dass große Bilder unter Beibehaltung ihres Seitenverhältnisses verkleinert werden, bis ihre Pixelanzahl in etwa mit einem 800 mal 800-Bild vergleichbar ist. Jedes Bild ist auf 384-Eingabetoken begrenzt.
Dies macht die Bildeingabe zwar kostengünstig, erklärt aber auch, warum ein großer Screenshot möglicherweise keine bessere OCR liefert. Ein 5,000-Pixel-Bild und ein 2,000-Pixel-Bild können nach der Größenänderung die gleiche Tokenanzahl aufweisen. Mehr Pixel in der Originaldatei garantieren nicht, dass die Details im Modell besser lesbar sind.
Für dichte Screenshots schneiden Sie vor dem Senden den entsprechenden Bereich zu. Verwenden Sie für ein langes Dashboard mehrere gezielte Ausschnitte anstelle einer ganzseitigen Erfassung. Fordern Sie bei Dokumentenarbeiten zunächst eine Transkription und dann eine strukturierte Interpretation an. Das unterscheidet einen Lesefehler von einem Denkfehler.
Die aktuelle API erlaubt bis zu 600-Bilder in einer Anfrage, aber diese Grenze sollte nicht mit einer empfohlenen Stapelgröße verwechselt werden. Bei großen Batches ist es schwieriger zu erkennen, welches Bild eine falsche Antwort verursacht hat, und für die Gesamtanfrage gelten separate Bytegrößenbeschränkungen. Beginnen Sie mit der kleinsten Menge, die die Frage beantworten kann.
API-Format und eine minimale Anforderung
DeepSeek verwendet das bekannte Chat-Format OpenAI. Ein Bild und eine Frage befinden sich in derselben Benutzernachricht wie Inhaltsblöcke:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": {"url": "https://example.com/chart.png"},
},
{
"type": "text",
"text": "List the three largest changes and cite the labels you read.",
},
],
}],
)
print(response.choices[0].message.content)
Externe URLs sind praktisch für öffentliche Assets. Base64 ist nützlich für ein Bild, das sich bereits im Speicher befindet, vergrößert jedoch den Anforderungstext. Ein file_id ist normalerweise die sauberere Wahl, wenn derselbe Screenshot oder dasselbe Dokument in mehreren Anfragen verwendet wird.
Bilder werden nur in Benutzernachrichten akzeptiert. Beim Einfügen eines Bildes in eine System- oder Assistentenmeldung wird ein Fehler zurückgegeben. DeepSeek begrenzt außerdem die Länge externer URLs auf 8,192-Zeichen, ein einzelnes URL/Basis-64-Bild auf 32 MiB und ein Datei-API-Bild auf 64 MiB.
DeepSeek V4 Flash Vision Exp-Preis
DeepSeek berechnet Bild-Tokens zusammen mit Texteingabe-Tokens. Auf der offiziellen Preisseite verwendet der experimentelle Vision-Endpunkt die gleichen V4-Flash-Raten:
| Tokentyp | Außerhalb der Hauptverkehrszeit | Höhepunkt |
|---|---|---|
| Zwischengespeicherte Eingabe | $0.007 / 1M | $0.014 / 1M |
| Nicht zwischengespeicherte Eingabe | $0.22 / 1M | $0.44 / 1M |
| Ausgabe | $0.66 / 1M | $1.32 / 1M |
DeepSeek definiert Spitzenzeiten als 01:00–04:00 und 06:00–10:00 UTC, Montag bis Freitag. Für alle anderen Stunden gilt der Off-Peak-Tarif. Preise und Zeitfenster können sich ändern. Schauen Sie sich daher die Preisseite an, bevor Sie einen Test in einen geplanten Produktionsauftrag umwandeln.
Da jedes Bild bei 384-Eingabetokens die Höchstgrenze erreicht, ist der Bildanteil allein bei den aktuellen Raten winzig. Die Ausgabelänge, der wiederholte, nicht zwischengespeicherte Kontext und die Anzahl der Aufrufe spielen normalerweise eine größere Rolle. Ein Workflow, der nach einem prägnanten JSON-Objekt fragt, kann viel weniger kosten als einer, der eine lange Erzählung zu jedem Bild einlädt.
Eine sinnvolle Bewertungscheckliste
Beginnen Sie nicht mit einem ausgefeilten Demobild. Verwenden Sie das Material, das normalerweise Ihren Arbeitsablauf unterbricht.
- Wählen Sie repräsentative Bilder von 20 bis 50 aus, einschließlich verschwommener, breiter, dunkler und textreicher Beispiele.
- Definieren Sie ein Antwortformat, das mechanisch überprüft werden kann.
- Erfassen Sie fehlende und fehlerhafte Felder getrennt.
- Wiederholen Sie einige identische Anfragen, um die Konsistenz zu messen.
- Vergleichen Sie Ausschnitte mit Vollbildern für Feintextaufgaben.
- Testtool-Aufrufe erst, wenn die visuelle Extraktion selbst zuverlässig ist.
Berechnen Sie für OCR die Feldgenauigkeit, anstatt zu fragen, ob die Ausgabe „richtig aussieht“. Berücksichtigen Sie beim Lesen von Diagrammen auch Diagramme mit irreführenden Maßstäben und Schlusswerten. Überprüfen Sie bei Schnittstellenagenten die Koordinaten oder Elementbeschreibungen, bevor Sie eine Aktion mit Konsequenzen zulassen.
Bei der Sehanalyse handelt es sich nicht um eine Bild-zu-Prompt-Rekonstruktion
DeepSeek V4 Flash Vision Exp kann ein Bild beschreiben und seinen Inhalt begründen. Die Rekonstruktion einer nützlichen Generierungsaufforderung ist eine engere kreative Aufgabe: Sie erfordert Entscheidungen über Komposition, Beleuchtung, Linsensprache, Materialien, Stil und darüber, welche Details weggelassen werden sollten.
Wenn das Ihr Ziel ist, probieren Sie den kostenlosen Image to Prompt Generator von Yix aus. Es handelt sich um einen separaten Arbeitsablauf, der dazu dient, ein Referenzbild in eine bearbeitbare Eingabeaufforderung für die Bildgenerierung umzuwandeln. Anschließend können Sie Optionen im Yix-Modellverzeichnis vergleichen. Der Endpunkt von DeepSeek ist derzeit kein auswählbares Generationsmodell auf Yix.
Lohnt es sich, es zu verwenden?
DeepSeek V4 Flash Vision Exp ist am überzeugendsten, wenn das Bildverstehen ein Schritt innerhalb eines größeren, Werkzeug verwendenden Arbeitsablaufs ist. Die niedrige Bild-Token-Obergrenze macht das Experimentieren kostengünstig, die kompatiblen APIs reduzieren den Integrationsaufwand und das lange Kontextfenster lässt Raum für Anweisungen und unterstützende Dokumente.
Der Kompromiss liegt schon im Namen: Exp bedeutet experimentell. Das Größenänderungsverhalten legt auch eine praktische Obergrenze für feine visuelle Details fest. Betrachten Sie es als vielversprechende, kostengünstige Komponente und nicht als automatischen Ersatz für eine dedizierte OCR-Engine oder eine getestete Dokumentenpipeline.
Beginnen Sie mit den Pflanzen, fordern Sie strukturierte Antworten, messen Sie echte Fehler und behalten Sie einen Rückgriff auf kritische Felder bei. Das verrät Ihnen mehr als jeder Ranglisten-Score.
Verwandte Schnellmodell-Anleitungen
Vergleichen Sie für ein anderes multimodales Modell mit einem 1M-Kontextfenster Qwen3.8 Flash mit Flash-Next. Um das kurzlebige Stealth-Modell zu verstehen, das zu einer offenen Version wurde, lesen Sie den Ox Alpha- und GLM-5.3-Flash-Leitfaden.
Quellen: DeepSeek Veröffentlichungsankündigung, DeepSeek Vision Guide und DeepSeek Preise.
DeepSeek ist eine Marke des jeweiligen Eigentümers. Yix ist nicht mit DeepSeek verbunden.