DeepSeek V4 Flash Vision Exp: API, preços e limites de imagens
Um guia prático para DeepSeek V4 Flash Vision Exp: imagens suportadas, formatos de API, preços de tokens, casos de uso de OCR e os limites e compensações para testar primeiro.

DeepSeek V4 Flash Vision Exp é o primeiro endpoint Flash V4 do DeepSeek que pode ler imagens junto com texto. É um modelo experimental de linguagem de visão, não um gerador de imagens: você envia capturas de tela, gráficos, documentos ou fotografias e recebe uma resposta em texto.
DeepSeek lançou o modelo em agosto 21, 2026. Os números principais são excepcionalmente generosos para um modelo rápido: uma janela de contexto de 1 milhão de tokens, até tokens de saída 384K, chamada de ferramenta, saída JSON e suporte para APIs compatíveis com OpenAI e Anthropic. Os detalhes mais importantes, entretanto, estão ocultos na forma como as imagens são redimensionadas, contadas e fornecidas.
Este guia explica o que a API realmente aceita, quanto custa e onde um pequeno teste real é mais valioso do que outra tabela de benchmark.
O que DeepSeek V4 Flash Vision Exp faz
O ID do modelo é deepseek-v4-flash-vision-exp. De acordo com o anúncio de lançamento do DeepSeek, ele aceita entrada mista de texto e imagem e retorna texto. Trabalhos típicos incluem:
- leitura de rótulos, tabelas e texto de interface de capturas de tela;
- explicar um gráfico ou diagrama;
- comparar diversas imagens de produtos;
- inspecionar um estado de erro visual antes de chamar uma ferramenta;
- transformar uma imagem de documento em JSON estruturado;
- respondendo a perguntas sobre uma fotografia.
Esse último ponto precisa de um limite. Um modelo de linguagem de visão pode descrever o que vê, mas uma resposta confiável não é o mesmo que uma resposta verificada. Texto pequeno, tabelas lotadas, símbolos incomuns, contagens precisas e objetos visualmente semelhantes ainda merecem uma segunda verificação.
O modelo suporta JPEG, PNG, GIF e WebP. DeepSeek detecta o conteúdo real do arquivo em vez de confiar na extensão ou no tipo MIME declarado. As imagens podem ser enviadas inline como base64, obtidas de um URL externo ou carregadas uma vez por meio da API de arquivos e referenciadas posteriormente com um file_id.
A regra do token de imagem é mais importante do que a resolução
A documentação de visão de DeepSeek diz que imagens grandes são reduzidas enquanto preservam sua proporção até que sua contagem de pixels seja aproximadamente comparável a uma imagem 800 por 800. Cada imagem é limitada a tokens de entrada 384.
Isso torna a entrada de imagem barata, mas também explica por que uma captura de tela enorme pode não produzir um OCR melhor. Uma imagem de pixel 5,000 e uma imagem de pixel 2,000 podem terminar com a mesma contagem de tokens após o redimensionamento. Mais pixels no arquivo original não garantem detalhes mais legíveis dentro do modelo.
Para capturas de tela densas, corte a região relevante antes de enviá-las. Para um painel longo, use vários cortes intencionais em vez de uma captura de página inteira. Para trabalhos documentais, peça primeiro uma transcrição e depois uma interpretação estruturada. Isso separa um erro de leitura de um erro de raciocínio.
A API atual permite até imagens 600 em uma solicitação, mas esse limite não deve ser confundido com um tamanho de lote recomendado. Lotes grandes tornam mais difícil identificar qual imagem causou uma resposta incorreta, e a solicitação total tem limites de tamanho de bytes separados. Comece com o menor conjunto que possa responder à pergunta.
Formato API e uma solicitação mínima
DeepSeek usa o formato de bate-papo familiar OpenAI. Uma imagem e uma pergunta residem na mesma mensagem do usuário que os blocos de conteúdo:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": {"url": "https://example.com/chart.png"},
},
{
"type": "text",
"text": "List the three largest changes and cite the labels you read.",
},
],
}],
)
print(response.choices[0].message.content)
URLs externos são convenientes para ativos públicos. Base64 é útil para uma imagem já na memória, mas amplia o corpo da solicitação. Um file_id geralmente é a escolha mais limpa quando a mesma captura de tela ou documento será usado em diversas solicitações.
Imagens são aceitas apenas em mensagens de usuários. Colocar uma imagem em uma mensagem do sistema ou do assistente retorna um erro. DeepSeek também limita o comprimento do URL externo em caracteres 8,192, uma única imagem URL/base64 em 32 MiB e uma imagem de API de arquivos em 64 MiB.
Preços DeepSeek V4 Flash Vision Exp
DeepSeek fatura tokens de imagem junto com tokens de entrada de texto. Na página oficial de preços, o endpoint de visão experimental usa as mesmas taxas de Flash V4:
| Tipo de token | Fora do horário de pico | Pico |
|---|---|---|
| Entrada em cache | $0.007 / 1M | $0.014 / 1M |
| Entrada sem cache | $0.22 / 1M | $0.44 / 1M |
| Saída | $0.66 / 1M | $1.32 / 1M |
DeepSeek define períodos de pico como 01:00–04:00 e 06:00–10:00 UTC, de segunda a sexta-feira. Todos os outros horários usam a tarifa fora de pico. Os preços e as janelas de tempo podem mudar, portanto verifique a página de preços antes de transformar um teste em um trabalho de produção agendado.
Como cada imagem atinge o máximo de tokens de entrada 384, a parte da imagem por si só é pequena nas taxas atuais. O comprimento da saída, o contexto repetido sem cache e o número de chamadas geralmente serão mais importantes. Um fluxo de trabalho que solicita um objeto JSON conciso pode custar muito menos do que aquele que convida a uma longa narrativa em cada imagem.
Uma lista de verificação de avaliação sensata
Não comece com uma imagem de demonstração refinada. Use o material que normalmente atrapalha seu fluxo de trabalho.
- Escolha imagens representativas de 20 a 50, incluindo exemplos desfocados, amplos, escuros e com muito texto.
- Defina um formato de resposta que possa ser verificado mecanicamente.
- Registre os campos ausentes e os campos incorretos separadamente.
- Repita algumas solicitações idênticas para medir a consistência.
- Compare recortes com imagens completas para tarefas de texto fino.
- A ferramenta de teste é chamada somente depois que a extração visual em si é confiável.
Para OCR, calcule a precisão do campo em vez de perguntar se a saída “parece correta”. Para leitura de gráficos, inclua gráficos com escalas enganosas e valores próximos. Para agentes de interface, verifique as coordenadas ou as descrições dos elementos antes de permitir uma ação com consequências.
A análise da visão não é uma reconstrução da imagem para o prompt
DeepSeek V4 Flash Vision Exp pode descrever uma imagem e raciocinar sobre seu conteúdo. Reconstruir um prompt de geração útil é uma tarefa criativa mais restrita: requer decisões sobre composição, iluminação, linguagem da lente, materiais, estilo e quais detalhes devem ser omitidos.
Se esse for seu objetivo, experimente o Gerador de imagem para prompt gratuito do Yix . É um fluxo de trabalho separado projetado para transformar uma imagem de referência em um prompt editável para geração de imagem. Você pode então comparar as opções no diretório do modelo Yix. O endpoint do DeepSeek não é atualmente um modelo de geração selecionável no Yix.
Vale a pena usar?
DeepSeek V4 Flash Vision Exp é mais atraente quando a compreensão da imagem é uma etapa dentro de um fluxo de trabalho maior que utiliza ferramentas. O teto baixo de tokens de imagem torna a experimentação barata, as APIs compatíveis reduzem o trabalho de integração e a longa janela de contexto deixa espaço para instruções e documentos de suporte.
A compensação está certa no nome: Exp significa experimental. O comportamento de redimensionamento também estabelece um limite prático para detalhes visuais finos. Trate-o como um componente promissor e de baixo custo, e não como um substituto automático para um mecanismo de OCR dedicado ou um pipeline de documentos testado.
Comece com as culturas, exija respostas estruturadas, meça erros reais e mantenha um substituto para campos críticos. Isso lhe dirá mais do que qualquer pontuação na tabela de classificação.
Guias de modelos rápidos relacionados
Para outro modelo multimodal com uma janela de contexto 1M, compare Qwen3.8 Flash com Flash-Next. Para entender o modelo furtivo de curta duração que se tornou um lançamento aberto, leia o guia Ox Alpha e GLM-5.3-Flash.
Fontes: anúncio de lançamento de DeepSeek, guia de visão DeepSeek e preços de DeepSeek.
DeepSeek é uma marca registrada de seu respectivo proprietário. Yix não é afiliado a DeepSeek.