返回博客

DeepSeek V4 Flash Vision Exp:API、价格与图片限制

读懂 DeepSeek V4 Flash Vision Exp:支持的图片格式、API 接入、Token 价格、OCR 场景以及最值得先测试的限制。

更新于 2026年8月27日Yix TeamYix Team
DeepSeek V4 Flash Vision Exp:API、价格与图片限制

DeepSeek V4 Flash Vision Exp 是 DeepSeek 在 2026 年 8 月 21 日上线的实验性视觉语言模型。它不是图片生成器,而是“看图后输出文字”的模型:你可以给它截图、图表、文档照片或多张商品图,让它识别文字、比较差异、解释内容,再把结果交给后续工具。

官方给出的规格很抢眼:100 万 Token 上下文、最高 38.4 万 Token 输出,支持 JSON、工具调用,以及 OpenAI 和 Anthropic 兼容接口。不过,真正影响使用效果的并不是这些大数字,而是图片会怎样缩放、计费,以及怎样提问。

它能处理哪些图片任务

根据 DeepSeek 发布说明,接口使用的模型名是 deepseek-v4-flash-vision-exp,可在同一条用户消息中混合文字和图片。比较适合的任务包括:

  • 读取网页或 App 截图中的文字与状态;
  • 解释图表、流程图和示意图;
  • 对比多张商品图或设计稿;
  • 把票据、表格、文档照片整理成 JSON;
  • 在 Agent 执行动作前识别页面异常。

模型支持 JPEG、PNG、GIF 和 WebP。图片既可以写成 base64,也可以提供公网 URL;同一张图片要反复使用时,还可以先上传到 Files API,再通过 file_id 引用。

视觉模型给出的肯定语气不等于事实已经核实。小字号、密集表格、特殊符号、相似物体和精确计数仍然容易出错,涉及金额、合同字段或自动操作时必须做二次校验。

384 Token 图片上限意味着什么

官方视觉文档说明,大图会按原比例缩小到大约 800×800 像素的总面积,每张图片最多计 384 个输入 Token。这个规则让看图成本很低,却也意味着上传 5000×5000 的原图未必比 2000×2000 更清楚:两者缩放后可能得到相同的视觉输入。

如果你要读长网页截图,不要把整页一次扔进去。先裁出表格、报错区域或关键组件,再分别提问。处理文档时,可以先要求逐字转录,再单独要求归纳或结构化。这样一旦出错,能分清是“没看清”还是“理解错了”。

当前单次请求最多可放 600 张图片,但这只是技术上限,不是推荐批量。图片太多时,很难定位是哪张导致错误,也会碰到请求体积限制。实际工作应从能回答问题的最小图片集合开始。

最小 API 示例

接口沿用 OpenAI Chat Completions 的内容块格式:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {
                "type": "image_url",
                "image_url": {"url": "https://example.com/chart.png"},
            },
            {
                "type": "text",
                "text": "列出变化最大的三项,并写出你读到的原始标签。",
            },
        ],
    }],
)

print(response.choices[0].message.content)

公网图片适合直接用 URL;本地内存中的图片可用 base64,但请求体会明显变大;多轮复用同一文件时,file_id 更省带宽。图片只能放在 user 消息里,放到 system 或 assistant 消息会返回错误。

官方还限制:外部 URL 最长 8192 字符,URL/base64 单图最大 32 MiB,Files API 单图最大 64 MiB。接入前最好把这些约束写进上传校验,而不是等生产请求失败。

DeepSeek V4 Flash Vision Exp 价格

图片 Token 会和文本输入 Token 一起计费。DeepSeek 官方价格页显示,视觉实验版采用 V4 Flash 同档价格:

Token 类型非高峰高峰
缓存命中输入$0.007 / 百万$0.014 / 百万
未缓存输入$0.22 / 百万$0.44 / 百万
输出$0.66 / 百万$1.32 / 百万

周一至周五的 UTC 01:00–04:00、06:00–10:00 属于高峰时段,其余时间为非高峰。正式批量运行前仍应查看官方页面,因为价格和时段可能调整。

单张图片最多 384 Token,因此图片本身通常不是成本大头。真正容易放大费用的是冗长输出、反复发送未缓存上下文,以及无控制的重试。让模型返回简洁 JSON,往往比每张图都生成长篇解释更省。

怎样判断它是否适合你的业务

不要只拿一张清晰海报做演示。准备 20–50 张真实样本,把模糊、超宽、暗色、密集文字和异常布局都放进去,并提前定义可机械检查的答案格式。

OCR 场景应统计字段正确率,而不是凭感觉判断“差不多”;图表场景要加入近似数值和误导性坐标轴;界面 Agent 则要在真正点击前核对控件名称、位置与当前状态。对同一输入重复请求几次,还能看出结果是否稳定。

看图分析不等于反推提示词

DeepSeek V4 Flash Vision Exp 能描述图片、识别内容并推理,但把参考图还原成好用的生成提示词,是另一种更具体的创作任务。它需要提炼构图、光线、镜头、材质与风格,还要知道哪些细节不该照搬。

如果你的目标是从图片获得可编辑的生成提示词,可以使用 Yix 免费的图片转提示词工具,再到模型目录选择生成模型。这是一条独立的图片提示词工作流;DeepSeek 目前并不是 Yix 可选的图片生成模型。

结论

DeepSeek V4 Flash Vision Exp 最适合做复杂流程中的“视觉理解一步”:先读截图或文档,再输出结构化结果或触发工具。它的图片输入便宜、接口迁移成本低,上下文也足够大。

Exp 仍代表实验版本,统一缩放也限制了细节识别能力。先裁图、要求结构化答案、用真实坏样本测错误率,并为关键字段保留兜底方案,才是比单看跑分更可靠的采用方式。

相关阅读

想比较另一个拥有 100 万上下文的多模态模型,可以继续看 Qwen3.8 Flash 与 Flash-Next 指南;想了解匿名模型如何变成正式开源版本,可以阅读 Ox Alpha 与 GLM-5.3-Flash 指南

资料来源:DeepSeek 发布说明视觉接口文档官方价格页

DeepSeek 是其权利人的商标,Yix 与 DeepSeek 无关联。