가이드 목록으로

DeepSeek V4 Flash Vision Exp: API 요금과 이미지 입력 제한

DeepSeek V4 Flash Vision Exp의 지원 이미지, API 형식, 토큰 요금과 OCR 활용법을 정리했습니다. 도입 전에 확인할 제한 사항과 주의점도 알아보세요.

마지막 업데이트: 2026년 8월 27일Yix TeamYix Team
DeepSeek V4 Flash Vision Exp: API 요금과 이미지 입력 제한

DeepSeek V4 Flash Vision Exp는 텍스트와 함께 이미지를 읽을 수 있는 DeepSeek의 첫 번째 V4 Flash 엔드포인트입니다. 이는 이미지 생성기가 아닌 실험적인 비전 언어 모델입니다. 스크린샷, 차트, 문서 또는 사진을 보내고 텍스트 응답을 받습니다.

DeepSeek는 2026년 8월 21일 모델을 출시했습니다. 100만 개의 토큰 컨텍스트 창, 최대 384K 출력 토큰, 도구 호출, JSON 출력, OpenAI 및 Anthropic 호환 API에 대한 지원 등 헤드라인 숫자는 빠른 모델에 대해 유난히 관대합니다. 그러나 더 중요한 세부 사항은 이미지 크기 조정, 계산 및 제공 방법에 숨겨져 있습니다.

이 가이드에서는 API가 실제로 허용하는 사항, 비용, 소규모 실제 테스트가 다른 벤치마크 테이블보다 더 가치 있는 부분에 대해 설명합니다.

DeepSeek V4 Flash Vision Exp의 기능

모델 ID는 deepseek-v4-flash-vision-exp입니다. DeepSeek의 출시 발표에 따르면 텍스트와 이미지 혼합 입력을 허용하고 텍스트를 반환합니다. 일반적인 작업은 다음과 같습니다.

  • 스크린샷에서 라벨, 표, 인터페이스 텍스트 읽기
  • 차트나 다이어그램을 설명합니다.
  • 여러 제품 이미지를 비교합니다.
  • 도구를 호출하기 전에 시각적 오류 상태를 검사합니다.
  • 문서 이미지를 구조화된 JSON으로 변환합니다.
  • 사진에 대한 질문에 답합니다.

마지막 지점에는 경계가 필요합니다. 비전 언어 모델은 자신이 보는 것을 설명할 수 있지만 자신 있는 답변은 검증된 답변과 동일하지 않습니다. 작은 텍스트, 복잡한 표, 특이한 기호, 정확한 개수, 시각적으로 유사한 개체는 여전히 두 번째 확인이 필요합니다.

이 모델은 JPEG, PNG, GIF 및 WebP를 지원합니다. DeepSeek는 확장명이나 선언된 MIME 유형을 신뢰하는 대신 실제 파일 내용을 감지합니다. 이미지는 base64로 인라인으로 전송되거나, 외부 URL에서 가져오거나, Files API를 통해 한 번 업로드하고 나중에 file_id로 참조할 수 있습니다.

이미지 토큰 규칙은 해상도보다 더 중요합니다.

DeepSeek의 비전 문서에는 픽셀 수가 800 by 800 이미지와 대략 비슷해질 때까지 가로 세로 비율을 유지하면서 큰 이미지가 축소된다고 나와 있습니다. 각 이미지는 384 입력 토큰으로 제한됩니다.

이로 인해 이미지 입력 비용이 저렴해지지만 거대한 스크린샷이 더 나은 OCR을 생성하지 못하는 이유도 설명됩니다. 5,000 픽셀 이미지와 2,000 픽셀 이미지는 크기 조정 후 동일한 토큰 수를 갖게 될 수 있습니다. 원본 파일에 픽셀이 많다고 해서 모델 내부의 세부 정보를 더 쉽게 읽을 수 있다고 보장되는 것은 아닙니다.

조밀한 스크린샷의 경우 전송하기 전에 관련 영역을 잘라냅니다. 긴 대시보드의 경우 전체 페이지를 한 번 캡처하는 대신 목적에 맞는 여러 자르기를 사용하세요. 문서 작업의 경우 먼저 전사본을 요청하고 그 다음 구조화된 해석을 요청합니다. 이는 읽기 오류와 추론 오류를 구분합니다.

현재 API는 한 요청에 최대 600 이미지를 허용하지만 해당 제한을 권장 배치 크기로 착각해서는 안 됩니다. 배치가 크면 어떤 이미지가 잘못된 답변을 야기했는지 식별하기가 더 어려워지고 총 요청에는 별도의 바이트 크기 제한이 있습니다. 질문에 답할 수 있는 가장 작은 세트부터 시작하세요.

API 형식 및 최소한의 요청

DeepSeek는 익숙한 OpenAI 채팅 형식을 사용합니다. 이미지와 질문은 콘텐츠 블록과 동일한 사용자 메시지에 있습니다.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {
                "type": "image_url",
                "image_url": {"url": "https://example.com/chart.png"},
            },
            {
                "type": "text",
                "text": "List the three largest changes and cite the labels you read.",
            },
        ],
    }],
)

print(response.choices[0].message.content)

외부 URL은 공공 자산에 편리합니다. Base64는 이미 메모리에 있는 이미지에 유용하지만 요청 본문을 확대합니다. file_id는 일반적으로 동일한 스크린샷이나 문서가 여러 요청에 사용될 때 더 깔끔한 선택입니다.

이미지는 사용자 메시지에서만 허용됩니다. 시스템이나 보조자 메시지에 이미지를 넣으면 오류가 반환됩니다. DeepSeek는 또한 외부 URL 길이를 8,192 문자로, 단일 URL/base64 이미지를 32 MiB로, 파일 API 이미지를 64 MiB로 제한합니다.

DeepSeek V4 Flash Vision Exp 요금

DeepSeek는 텍스트 입력 토큰과 함께 이미지 토큰을 청구합니다. 공식 가격 페이지에서 실험적 비전 엔드포인트는 동일한 V4 플래시 속도를 사용합니다.

토큰 유형비수기피크
캐시된 입력$0.007 / 1M$0.014 / 1M
캐시되지 않은 입력$0.22 / 1M$0.44 / 1M
출력$0.66 / 1M$1.32 / 1M

DeepSeek는 피크 기간을 월요일부터 금요일까지 01:00–04:00 및 06:00–10:00 UTC로 정의합니다. 그 외 시간에는 비수기 요금을 적용합니다. 가격과 기간은 변경될 수 있으므로 테스트를 예정된 생산 작업으로 전환하기 전에 가격 페이지를 확인하세요.

각 이미지는 384 입력 토큰으로 구성되므로 현재 속도에서는 이미지 부분만 작습니다. 일반적으로 출력 길이, 캐시되지 않은 반복 컨텍스트 및 호출 수가 더 중요합니다. 간결한 JSON 개체를 요청하는 작업 흐름은 모든 이미지에 긴 설명을 요청하는 작업 흐름보다 비용이 훨씬 저렴할 수 있습니다.

합리적인 평가 체크리스트

세련된 데모 이미지로 시작하지 마십시오. 일반적으로 작업 흐름을 방해하는 자료를 사용하십시오.

  1. 흐릿하고 넓고 어둡고 텍스트가 많은 예를 포함하여 20 ~ 50 대표 이미지를 선택하세요.
  2. 기계적으로 확인할 수 있는 답변 형식을 정의합니다.
  3. 누락된 필드와 잘못된 필드를 별도로 기록합니다.
  4. 일관성을 측정하기 위해 몇 가지 동일한 요청을 반복합니다.
  5. 미세한 텍스트 작업을 위해 자르기를 전체 이미지와 비교합니다.
  6. 테스트 도구는 시각적 추출 자체가 신뢰할 수 있는 후에만 호출됩니다.

OCR의 경우 출력이 "올바르게 보이는지" 묻기보다는 필드 정확도를 계산하십시오. 차트 읽기의 경우 오해의 소지가 있는 척도와 종가가 포함된 차트를 포함하세요. 인터페이스 에이전트의 경우 결과가 있는 작업을 허용하기 전에 좌표나 요소 설명을 확인하세요.

비전 분석은 이미지를 프롬프트로 재구성하는 것이 아닙니다.

DeepSeek V4 Flash Vision Exp는 이미지와 콘텐츠에 대한 이유를 설명할 수 있습니다. 유용한 생성 프롬프트를 재구성하는 것은 보다 좁은 범위의 창의적 작업입니다. 구성, 조명, 렌즈 언어, 재료, 스타일 및 생략해야 할 세부 사항에 대한 결정이 필요합니다.

그것이 당신의 목표라면, Yix의 무료 이미지-프롬프트 생성기를 사용해 보세요. 이는 참조 이미지를 이미지 생성을 위한 편집 가능한 프롬프트로 전환하도록 설계된 별도의 워크플로우입니다. 그런 다음 Yix 모델 디렉토리에서 옵션을 비교할 수 있습니다. DeepSeek의 엔드포인트는 현재 Yix에서 선택 가능한 생성 모델이 아닙니다.

사용할 가치가 있나요?

DeepSeek V4 Flash Vision Exp는 이미지 이해가 더 큰 도구 사용 워크플로우 내에서 한 단계일 때 가장 강력합니다. 이미지 토큰 한도가 낮기 때문에 실험 비용이 저렴하고, 호환 가능한 API로 통합 작업이 줄어들고, 컨텍스트 창이 길어 지침과 지원 문서를 위한 공간이 남습니다.

이름에 바로 트레이드오프가 있습니다. Exp는 실험적이라는 뜻입니다. 크기 조정 동작은 또한 미세한 시각적 세부 사항에 대한 실질적인 한계를 설정합니다. 전용 OCR 엔진이나 테스트된 문서 파이프라인을 자동으로 대체하는 것이 아니라 유망하고 저렴한 구성 요소로 취급하십시오.

필요한 영역을 잘라서 시작하고, 구조화된 답변을 요구하고, 실제 오류를 측정하고, 중요한 필드에 대한 대체 조치를 유지하세요. 이는 리더보드 점수보다 더 많은 것을 알려줄 것입니다.

관련 빠른 모델 가이드

1M 컨텍스트 창이 있는 다른 다중 모드 모델의 경우 Qwen3.8 Flash와 Flash-Next를 비교하세요. 공개 출시된 단기 스텔스 모델을 이해하려면 Ox Alpha 및 GLM-5.3-플래시 가이드를 읽어보세요.

출처: DeepSeek 출시 발표, DeepSeek 비전 가이드DeepSeek 가격.

DeepSeek은 해당 소유자의 상표입니다. Yix는 DeepSeek와 관련이 없습니다.