DeepSeek V4 Flash Vision Exp: API, prezzi e limiti delle immagini
Una guida pratica a DeepSeek V4 Flash Vision Exp: immagini supportate, formati API, prezzi dei token, casi d'uso dell'OCR, limiti e compromessi da testare prima.

DeepSeek V4 Flash Vision Exp è il primo endpoint Flash V4 di DeepSeek in grado di leggere immagini insieme al testo. È un modello sperimentale di linguaggio visivo, non un generatore di immagini: invii screenshot, grafici, documenti o fotografie e ricevi una risposta testuale.
DeepSeek ha rilasciato il modello 21, 2026 in agosto. I numeri dei titoli sono insolitamente generosi per un modello veloce: una finestra di contesto da 1 milione di token, token di output fino a 384K, chiamata di strumenti, output JSON e supporto per API compatibili con OpenAI e Anthropic. I dettagli più importanti, tuttavia, sono nascosti nel modo in cui le immagini vengono ridimensionate, conteggiate e fornite.
Questa guida spiega cosa accetta effettivamente l'API, quanto costa e dove un piccolo test nel mondo reale è più prezioso di un'altra tabella di benchmark.
Cosa fa DeepSeek V4 Flash Vision Exp
L'ID del modello è deepseek-v4-flash-vision-exp. Secondo l'annuncio di rilascio di DeepSeek, accetta input misti di testo e immagini e restituisce testo. I lavori tipici includono:
- leggere etichette, tabelle e testo dell'interfaccia dagli screenshot;
- spiegare un grafico o un diagramma;
- confrontare diverse immagini di prodotti;
- ispezionare uno stato di errore visivo prima di chiamare uno strumento;
- trasformare l'immagine di un documento in JSON strutturato;
- rispondere a domande su una fotografia.
Quest'ultimo punto ha bisogno di un confine. Un modello visione-linguaggio può descrivere ciò che vede, ma una risposta sicura non è la stessa cosa di una risposta verificata. Testo piccolo, tabelle affollate, simboli insoliti, conteggi precisi e oggetti visivamente simili meritano ancora un secondo controllo.
Il modello supporta JPEG, PNG, GIF e WebP. DeepSeek rileva il contenuto reale del file anziché fidarsi dell'estensione o del tipo MIME dichiarato. Le immagini possono essere inviate in linea come base64, recuperate da un URL esterno o caricate una volta tramite l'API File e referenziate successivamente con file_id.
La regola del token immagine conta più della risoluzione
La documentazione sulla visione di DeepSeek afferma che le immagini di grandi dimensioni vengono ridimensionate preservando le proporzioni fino a quando il numero di pixel non è approssimativamente paragonabile a un'immagine 800 per 800. Ogni immagine è limitata ai token di input 384.
Ciò rende economico l'input delle immagini, ma spiega anche perché uno screenshot enorme potrebbe non produrre un OCR migliore. Un'immagine con pixel 5,000 e un'immagine con pixel 2,000 possono ritrovarsi con lo stesso conteggio di token dopo il ridimensionamento. Un numero maggiore di pixel nel file originale non garantisce dettagli più leggibili all'interno del modello.
Per screenshot densi, ritaglia la regione interessata prima di inviarla. Per una dashboard lunga, utilizza diversi ritagli mirati anziché un'acquisizione a pagina intera. Per i lavori documentali, chiedi prima una trascrizione e poi un'interpretazione strutturata. Ciò distingue un errore di lettura da un errore di ragionamento.
L'attuale API consente fino a 600 immagini in una richiesta, ma tale limite non deve essere confuso con una dimensione batch consigliata. I batch di grandi dimensioni rendono più difficile identificare quale immagine ha causato una risposta errata e la richiesta totale ha limiti di dimensione in byte separati. Inizia con il set più piccolo che può rispondere alla domanda.
Formato API e una richiesta minima
DeepSeek utilizza il familiare formato di chat OpenAI. Un'immagine e una domanda risiedono nello stesso messaggio utente come blocchi di contenuto:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": {"url": "https://example.com/chart.png"},
},
{
"type": "text",
"text": "List the three largest changes and cite the labels you read.",
},
],
}],
)
print(response.choices[0].message.content)
Gli URL esterni sono convenienti per le risorse pubbliche. Base64 è utile per un'immagine già in memoria, ma ingrandisce il corpo della richiesta. Uno file_id è solitamente la scelta più pulita quando lo stesso screenshot o documento verrà utilizzato in più richieste.
Le immagini sono accettate solo nei messaggi utente. L'inserimento di un'immagine in un messaggio di sistema o di assistente restituisce un errore. DeepSeek limita inoltre la lunghezza dell'URL esterno ai caratteri 8,192, una singola immagine URL/base64 al MiB 32 e un'immagine API File al MiB 64.
DeepSeek V4 Flash Vision Prezzi scad
DeepSeek fattura i token immagine insieme ai token di input di testo. Nella pagina dei prezzi ufficiali, l'endpoint di visione sperimentale utilizza le stesse velocità Flash V4:
| Tipo di token | Non di punta | Picco |
|---|---|---|
| Ingresso memorizzato nella cache | $0.007 / 1M | $0.014 / 1M |
| Ingresso non memorizzato nella cache | $0.22 / 1M | $0.44 / 1M |
| Uscita | $0.66 / 1M | $1.32 / 1M |
DeepSeek definisce i periodi di punta come 01:00–04:00 e 06:00–10:00 UTC, dal lunedì al venerdì. Tutte le altre ore utilizzano la tariffa ridotta. I prezzi e le finestre temporali possono cambiare, quindi controlla la pagina dei prezzi prima di trasformare un test in un lavoro di produzione programmato.
Poiché ogni immagine raggiunge il massimo con i token di input 384, la porzione di immagine da sola è minuscola alle velocità attuali. La lunghezza dell'output, il contesto ripetuto non nella cache e il numero di chiamate in genere contano di più. Un flusso di lavoro che richiede un oggetto JSON conciso può costare molto meno di uno che invita a una lunga narrazione su ogni immagine.
Una lista di controllo di valutazione sensata
Non iniziare con un'immagine demo raffinata. Utilizza il materiale che normalmente interrompe il tuo flusso di lavoro.
- Scegli immagini rappresentative da 20 a 50, inclusi esempi sfocati, larghi, scuri e ricchi di testo.
- Definire un formato di risposta che possa essere controllato meccanicamente.
- Registra separatamente i campi mancanti e quelli errati.
- Ripeti alcune richieste identiche per misurare la coerenza.
- Confronta i ritagli con le immagini complete per attività di testo ridotto.
- Lo strumento di test chiama solo dopo che l'estrazione visiva stessa è affidabile.
Per l'OCR, calcola la precisione del campo anziché chiedere se l'output "sembra corretto". Per la lettura dei grafici, includere grafici con scale e valori di chiusura fuorvianti. Per gli agenti di interfaccia, verificare le coordinate o le descrizioni degli elementi prima di consentire un'azione con conseguenze.
L'analisi della vista non è una ricostruzione dall'immagine al prompt
DeepSeek V4 Flash Vision Exp può descrivere un'immagine e ragionare sul suo contenuto. Ricostruire un suggerimento di generazione utile è un compito creativo più ristretto: richiede decisioni su composizione, illuminazione, linguaggio delle lenti, materiali, stile e quali dettagli dovrebbero essere omessi.
Se questo è il tuo obiettivo, prova il Generatore di immagini da richiedere gratuito di Yix. Si tratta di un flusso di lavoro separato progettato per trasformare un'immagine di riferimento in un prompt modificabile per la generazione di immagini. È quindi possibile confrontare le opzioni nella directory dei modelli Yix. L'endpoint di DeepSeek non è attualmente un modello di generazione selezionabile su Yix.
Vale la pena usarlo?
DeepSeek V4 Flash Vision Exp è particolarmente avvincente quando la comprensione delle immagini è una fase all'interno di un flusso di lavoro più ampio che utilizza strumenti. Il basso limite di token immagine rende la sperimentazione poco costosa, le API compatibili riducono il lavoro di integrazione e la lunga finestra di contesto lascia spazio per istruzioni e documenti di supporto.
Il compromesso è già nel nome: Exp significa sperimentale. Il comportamento di ridimensionamento stabilisce anche un limite pratico ai dettagli visivi fini. Trattatelo come un componente promettente e a basso costo, non come un sostituto automatico di un motore OCR dedicato o di una pipeline di documenti testata.
Inizia con le colture, chiedi risposte strutturate, misura gli errori reali e mantieni una riserva per i campi critici. Questo ti dirà più di qualsiasi punteggio in classifica.
Guide correlate al modello veloce
Per un altro modello multimodale con una finestra di contesto 1M, confrontare Qwen3.8 Flash con Flash-Next. Per comprendere il modello stealth di breve durata che è diventato una versione aperta, leggi la guida Ox Alpha e GLM-5.3-Flash.
Fonti: annuncio di rilascio di DeepSeek, guida alla visione di DeepSeek e prezzi di DeepSeek.
DeepSeek è un marchio del rispettivo proprietario. Yix non è affiliato con DeepSeek.