DeepSeek V4 Flash Vision Exp:API、价格与图片限制
读懂 DeepSeek V4 Flash Vision Exp:支持的图片格式、API 接入、Token 价格、OCR 场景以及最值得先测试的限制。

DeepSeek V4 Flash Vision Exp 是 DeepSeek 在 2026 年 8 月 21 日上线的实验性视觉语言模型。它不是图片生成器,而是“看图后输出文字”的模型:你可以给它截图、图表、文档照片或多张商品图,让它识别文字、比较差异、解释内容,再把结果交给后续工具。
官方给出的规格很抢眼:100 万 Token 上下文、最高 38.4 万 Token 输出,支持 JSON、工具调用,以及 OpenAI 和 Anthropic 兼容接口。不过,真正影响使用效果的并不是这些大数字,而是图片会怎样缩放、计费,以及怎样提问。
它能处理哪些图片任务
根据 DeepSeek 发布说明,接口使用的模型名是 deepseek-v4-flash-vision-exp,可在同一条用户消息中混合文字和图片。比较适合的任务包括:
- 读取网页或 App 截图中的文字与状态;
- 解释图表、流程图和示意图;
- 对比多张商品图或设计稿;
- 把票据、表格、文档照片整理成 JSON;
- 在 Agent 执行动作前识别页面异常。
模型支持 JPEG、PNG、GIF 和 WebP。图片既可以写成 base64,也可以提供公网 URL;同一张图片要反复使用时,还可以先上传到 Files API,再通过 file_id 引用。
视觉模型给出的肯定语气不等于事实已经核实。小字号、密集表格、特殊符号、相似物体和精确计数仍然容易出错,涉及金额、合同字段或自动操作时必须做二次校验。
384 Token 图片上限意味着什么
官方视觉文档说明,大图会按原比例缩小到大约 800×800 像素的总面积,每张图片最多计 384 个输入 Token。这个规则让看图成本很低,却也意味着上传 5000×5000 的原图未必比 2000×2000 更清楚:两者缩放后可能得到相同的视觉输入。
如果你要读长网页截图,不要把整页一次扔进去。先裁出表格、报错区域或关键组件,再分别提问。处理文档时,可以先要求逐字转录,再单独要求归纳或结构化。这样一旦出错,能分清是“没看清”还是“理解错了”。
当前单次请求最多可放 600 张图片,但这只是技术上限,不是推荐批量。图片太多时,很难定位是哪张导致错误,也会碰到请求体积限制。实际工作应从能回答问题的最小图片集合开始。
最小 API 示例
接口沿用 OpenAI Chat Completions 的内容块格式:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": {"url": "https://example.com/chart.png"},
},
{
"type": "text",
"text": "列出变化最大的三项,并写出你读到的原始标签。",
},
],
}],
)
print(response.choices[0].message.content)
公网图片适合直接用 URL;本地内存中的图片可用 base64,但请求体会明显变大;多轮复用同一文件时,file_id 更省带宽。图片只能放在 user 消息里,放到 system 或 assistant 消息会返回错误。
官方还限制:外部 URL 最长 8192 字符,URL/base64 单图最大 32 MiB,Files API 单图最大 64 MiB。接入前最好把这些约束写进上传校验,而不是等生产请求失败。
DeepSeek V4 Flash Vision Exp 价格
图片 Token 会和文本输入 Token 一起计费。DeepSeek 官方价格页显示,视觉实验版采用 V4 Flash 同档价格:
| Token 类型 | 非高峰 | 高峰 |
|---|---|---|
| 缓存命中输入 | $0.007 / 百万 | $0.014 / 百万 |
| 未缓存输入 | $0.22 / 百万 | $0.44 / 百万 |
| 输出 | $0.66 / 百万 | $1.32 / 百万 |
周一至周五的 UTC 01:00–04:00、06:00–10:00 属于高峰时段,其余时间为非高峰。正式批量运行前仍应查看官方页面,因为价格和时段可能调整。
单张图片最多 384 Token,因此图片本身通常不是成本大头。真正容易放大费用的是冗长输出、反复发送未缓存上下文,以及无控制的重试。让模型返回简洁 JSON,往往比每张图都生成长篇解释更省。
怎样判断它是否适合你的业务
不要只拿一张清晰海报做演示。准备 20–50 张真实样本,把模糊、超宽、暗色、密集文字和异常布局都放进去,并提前定义可机械检查的答案格式。
OCR 场景应统计字段正确率,而不是凭感觉判断“差不多”;图表场景要加入近似数值和误导性坐标轴;界面 Agent 则要在真正点击前核对控件名称、位置与当前状态。对同一输入重复请求几次,还能看出结果是否稳定。
看图分析不等于反推提示词
DeepSeek V4 Flash Vision Exp 能描述图片、识别内容并推理,但把参考图还原成好用的生成提示词,是另一种更具体的创作任务。它需要提炼构图、光线、镜头、材质与风格,还要知道哪些细节不该照搬。
如果你的目标是从图片获得可编辑的生成提示词,可以使用 Yix 免费的图片转提示词工具,再到模型目录选择生成模型。这是一条独立的图片提示词工作流;DeepSeek 目前并不是 Yix 可选的图片生成模型。
结论
DeepSeek V4 Flash Vision Exp 最适合做复杂流程中的“视觉理解一步”:先读截图或文档,再输出结构化结果或触发工具。它的图片输入便宜、接口迁移成本低,上下文也足够大。
但 Exp 仍代表实验版本,统一缩放也限制了细节识别能力。先裁图、要求结构化答案、用真实坏样本测错误率,并为关键字段保留兜底方案,才是比单看跑分更可靠的采用方式。
相关阅读
想比较另一个拥有 100 万上下文的多模态模型,可以继续看 Qwen3.8 Flash 与 Flash-Next 指南;想了解匿名模型如何变成正式开源版本,可以阅读 Ox Alpha 与 GLM-5.3-Flash 指南。
资料来源:DeepSeek 发布说明、视觉接口文档与官方价格页。
DeepSeek 是其权利人的商标,Yix 与 DeepSeek 无关联。