Yix
Volver a las guías

DeepSeek V4 Flash Vision Exp: API, precios y límites de imagen

Una guía práctica para DeepSeek V4 Flash Vision Exp: imágenes compatibles, formatos API, precios de tokens, casos de uso de OCR y los límites y compensaciones que se deben probar primero.

Última actualización: 27 ago 2026Yix TeamYix Team
DeepSeek V4 Flash Vision Exp: API, precios y límites de imagen

DeepSeek V4 Flash Vision Exp es el primer punto final Flash V4 de DeepSeek que puede leer imágenes junto con texto. Es un modelo experimental de visión y lenguaje, no un generador de imágenes: envías capturas de pantalla, gráficos, documentos o fotografías y recibes una respuesta de texto.

DeepSeek lanzó el modelo en agosto 21, 2026. Los números de los titulares son inusualmente generosos para un modelo rápido: una ventana de contexto de millones de tokens 1, hasta tokens de salida 384K, llamada de herramientas, salida JSON y soporte para API compatibles con OpenAI y Anthropic. Sin embargo, los detalles más importantes están ocultos en cómo se cambia el tamaño, se cuentan y se suministran las imágenes.

Esta guía explica qué acepta realmente la API, cuánto cuesta y dónde una pequeña prueba del mundo real es más valiosa que otra tabla de referencia.

Qué hace DeepSeek V4 Flash Vision Exp

El ID del modelo es deepseek-v4-flash-vision-exp. Según el [anuncio de lanzamiento] de DeepSeek (https://api-docs.deepseek.com/news/news260821/), acepta entradas mixtas de texto e imágenes y devuelve texto. Los trabajos típicos incluyen:

  • leer etiquetas, tablas y texto de interfaz a partir de capturas de pantalla;
  • explicar un cuadro o diagrama;
  • comparar varias imágenes de productos;
  • inspeccionar un estado de error visual antes de llamar a una herramienta;
  • convertir la imagen de un documento en JSON estructurado;
  • Responder preguntas sobre una fotografía.

Ese último punto necesita un límite. Un modelo de visión y lenguaje puede describir lo que ve, pero una respuesta segura no es lo mismo que una respuesta verificada. Los textos pequeños, las tablas abarrotadas, los símbolos inusuales, los conteos precisos y los objetos visualmente similares aún merecen una segunda revisión.

El modelo admite JPEG, PNG, GIF y WebP. DeepSeek detecta el contenido real del archivo en lugar de confiar en la extensión o el tipo MIME declarado. Las imágenes pueden enviarse en línea como base64, recuperarse de una URL externa o cargarse una vez a través de la API de archivos y referenciarse más tarde con un file_id.

La regla del token de imagen importa más que la resolución

La [documentación de visión] de DeepSeek (https://api-docs.deepseek.com/guides/vision/) dice que las imágenes grandes se reducen manteniendo su relación de aspecto hasta que su número de píxeles sea aproximadamente comparable a una imagen 800 por 800. Cada imagen tiene un límite de tokens de entrada 384.

Esto hace que la entrada de imágenes sea barata, pero también explica por qué una captura de pantalla enorme puede no producir un mejor OCR. Una imagen de píxeles 5,000 y una imagen de píxeles 2,000 pueden terminar con el mismo recuento de tokens después de cambiar el tamaño. Más píxeles en el archivo original no garantizan más detalles legibles dentro del modelo.

Para capturas de pantalla densas, recorte alrededor de la región relevante antes de enviarla. Para un panel largo, utilice varios recortes específicos en lugar de una captura de página completa. Para trabajos de documentos, solicite primero una transcripción y luego una interpretación estructurada. Eso separa un error de lectura de un error de razonamiento.

La API actual permite hasta imágenes 600 en una solicitud, pero ese límite no debe confundirse con un tamaño de lote recomendado. Los lotes grandes hacen que sea más difícil identificar qué imagen provocó una respuesta incorrecta y la solicitud total tiene límites de tamaño de bytes separados. Comience con el conjunto más pequeño que pueda responder la pregunta.

Formato API y una solicitud mínima.

DeepSeek utiliza el conocido formato de chat OpenAI. Una imagen y una pregunta se encuentran en el mismo mensaje de usuario como bloques de contenido:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {
                "type": "image_url",
                "image_url": {"url": "https://example.com/chart.png"},
            },
            {
                "type": "text",
                "text": "List the three largest changes and cite the labels you read.",
            },
        ],
    }],
)

print(response.choices[0].message.content)

Las URL externas son convenientes para los activos públicos. Base64 es útil para una imagen que ya está en la memoria, pero amplía el cuerpo de la solicitud. Un file_id suele ser la opción más limpia cuando se utilizará la misma captura de pantalla o documento en varias solicitudes.

Las imágenes se aceptan únicamente en los mensajes de los usuarios. Poner una imagen en un mensaje del sistema o del asistente devuelve un error. DeepSeek también limita la longitud de la URL externa a caracteres 8,192, una única imagen URL/base64 a 32 MiB y una imagen de API de archivos a 64 MiB.

Precios de DeepSeek V4 Flash Vision Exp

DeepSeek factura tokens de imágenes junto con tokens de entrada de texto. En la página oficial de precios, el punto final de visión experimental utiliza las mismas velocidades de flash V4:

Tipo de fichaFuera de horas picopico
Entrada en caché$0.007 / 1M$0.014 / 1M
Entrada sin caché$0.22 / 1M$0.44 / 1M
Salida$0.66 / 1M$1.32 / 1M

DeepSeek define los períodos pico como 01:00–04:00 y 06:00–10:00 UTC, de lunes a viernes. El resto de horas utilizan la tarifa valle. Los precios y los plazos pueden cambiar, así que consulte la página de precios antes de convertir una prueba en un trabajo de producción programado.

Debido a que cada imagen alcanza un máximo de tokens de entrada 384, la porción de la imagen por sí sola es pequeña a los precios actuales. La longitud de salida, el contexto repetido sin caché y la cantidad de llamadas generalmente serán más importantes. Un flujo de trabajo que solicita un objeto JSON conciso puede costar mucho menos que uno que invita a una narrativa larga sobre cada imagen.

Una lista de verificación de evaluación sensata

No comience con una imagen de demostración pulida. Utilice el material que normalmente interrumpe su flujo de trabajo.

  1. Elija imágenes representativas de 20 a 50, incluidos ejemplos borrosos, anchos, oscuros y con mucho texto.
  2. Defina un formato de respuesta que pueda comprobarse mecánicamente.
  3. Registre los campos faltantes y los campos incorrectos por separado.
  4. Repita algunas solicitudes idénticas para medir la coherencia.
  5. Compare cultivos con imágenes completas para tareas de texto fino.
  6. La herramienta de prueba llama solo después de que la extracción visual en sí sea confiable.

Para OCR, calcule la precisión del campo en lugar de preguntar si la salida "se ve bien". Para la lectura de gráficos, incluya gráficos con escalas engañosas y valores cercanos. Para los agentes de interfaz, verifique las coordenadas o las descripciones de los elementos antes de permitir una acción con consecuencias.

El análisis de la visión no es una reconstrucción de imagen a indicación

DeepSeek V4 Flash Vision Exp puede describir una imagen y razonar sobre su contenido. Reconstruir un mensaje de generación útil es una tarea creativa más limitada: requiere decisiones sobre composición, iluminación, lenguaje de lentes, materiales, estilo y qué detalles deben omitirse.

Si ese es su objetivo, pruebe el generador de imágenes para mensajes gratuito de Yix . Es un flujo de trabajo independiente diseñado para convertir una imagen de referencia en un mensaje editable para la generación de imágenes. Luego podrá comparar opciones en el directorio de modelos Yix. El terminal de DeepSeek no es actualmente un modelo de generación seleccionable en Yix.

¿Vale la pena usarlo?

DeepSeek V4 Flash Vision Exp es más convincente cuando la comprensión de la imagen es un paso dentro de un flujo de trabajo más amplio que utiliza herramientas. El techo bajo de tokens de imagen hace que la experimentación sea económica, las API compatibles reducen el trabajo de integración y la larga ventana de contexto deja espacio para instrucciones y documentos de respaldo.

La compensación está justo en el nombre: Exp significa experimental. El comportamiento de cambio de tamaño también establece un límite práctico para los detalles visuales finos. Trátelo como un componente prometedor y de bajo costo, no como un reemplazo automático de un motor de OCR dedicado o un proceso de documentos probado.

Comience con cultivos, exija respuestas estructuradas, mida errores reales y mantenga un respaldo para campos críticos. Eso le dirá más que cualquier puntuación en la tabla de clasificación.

Guías relacionadas de modelos rápidos

Para otro modelo multimodal con una ventana contextual 1M, compare Qwen3.8 Flash con Flash-Next. Para comprender el modelo sigiloso de corta duración que se convirtió en una versión abierta, lea la guía Ox Alpha y GLM-5.3-Flash.

Fuentes: anuncio de lanzamiento de DeepSeek, guía de visión de DeepSeek y precios de DeepSeek.

DeepSeek es una marca comercial de su respectivo propietario. Yix no está afiliado a DeepSeek.