TL;DR
DeepSeek V4 Flash Vision-Exp 支持文字与图片混合输入,可通过 URL、Base64 或 Files API 传图,并兼容 OpenAI 风格请求。首次接入建议先用小型 JPEG 或 PNG,在 user 消息中放图,并把官方 benchmark 视为厂商数据。
这张图来自 DeepSeek 官方公告,比较了 V4-Flash-Vision-Exp、V4-Flash-0731 和 Opus-4.8。来源:。
DeepSeek 视觉 API 这次是真的上线了,不再只是社区里给纯文本模型“接一双眼睛”的临时方案。8 月 21 日,DeepSeek 在 API 平台加入实验性模型 deepseek-v4-flash-vision-exp,同时发布了专门的 。如果你之前只看过 deepseek-v4-flash 的页面,容易错过这个变化:视觉能力对应的是一个单独的模型名,不是给原来的模型悄悄加了一个参数。
真正值得弄清楚的,也不是一句“它现在能看图”就结束了。图片怎么传、哪些限制会在批量任务里先撞上、Files API 到底值不值得用,以及官方 benchmark 应该怎么看,这些才决定它能不能进入你的工作流。本文先按官方文档把事实讲清楚,再补充目前已经出现的社区分享。我们没有使用 DeepSeek API Key 跑一轮 Mengbi 自己的测试,所以涉及效果的地方会明确标成官方说法,不把发布会数据包装成独立实测。
先说结论:DeepSeek 视觉 API 能用了么?
可以。官方文档中的模型名是 deepseek-v4-flash-vision-exp。它接受文字以及 JPEG、PNG、GIF、WebP 图片,最常见的调用方式是 OpenAI 兼容的 Chat Completions。DeepSeek 还给出了 Responses API、兼容 Anthropic 的 /messages 接口,以及可以先上传、后续反复引用的 Files API。
第一次接入时,建议先拿一张不太大的截图或图表做验证。如果只是判断大致内容,可以把 detail 设成 low;如果要读坐标轴、表格小字,再考虑 high 或 original。还有一个容易踩坑的地方:Chat Completions 里图片只能放在 user 消息,放到 system 或 assistant 会直接得到 400。其他不支持视觉的模型也不会因为你传了图片就自动切换。
简单整理一下:
DeepSeek 视觉 API 怎么调用?
官方接口仍然是熟悉的 OpenAI 兼容地址 api.deepseek.com/chat/completions。关键变化在于 user 消息的 content 不再只是字符串,而是一个数组:一块放问题,一块放 image_url。
这是根据官方请求格式整理的示例,不代表 Mengbi 已经用线上 Key 跑过。生产环境里要把 Key 放在服务端,给请求加超时,并把模型名和图片哈希一起记下来。前端明明收到了图片,后端却只把文件名传给模型,是视觉接口刚上线时最容易出现的一类“看起来调用成功、结果却答非所问”的问题。
如果你的系统已经采用 Anthropic 的消息格式,也不用整个重写。DeepSeek 的 里,图片对应的是带 source 的 image block,可以是 base64、url 或 file。Responses API 则使用 input_image。第一次接入最好先选定一种格式,把适配层写清楚,再考虑同时兼容多个端点。
V4 Flash Vision-Exp 有哪几种传图方式?
Vision 文档给了三条路。没有哪一种“永远最好”,要看图片是不是私有、会不会复用,以及它现在放在哪里。
一次性处理截图时,Base64 最省事。图片已经有 CDN 地址时,URL 更直观,也方便重试。要做文档审阅队列,Files API 更合适:先上传,保存 file_id,之后的问题都引用同一个源文件。具体上传和复用方式可以看 DeepSeek 的 。
官方文档还特别说明,服务端判断图片看的是实际文件内容,不是文件名后缀或你填写的 MIME 类型。这个细节可以避免一部分“扩展名写对了、内容却不是图片”的误会,但本地仍然应该先做文件类型和大小校验。
图片 detail、token 和硬限制
视觉接口有两类限制:模型实际会看多细,以及 API 愿意接收多大的请求。把这两件事混在一起,批量任务就很容易出现“请求合法,但又慢又贵”的情况。
还有一条经常被漏看的角色规则:Chat Completions 里图片只能出现在 user 消息。把图片放在 system 或 assistant 消息里,接口会返回 400。要把视觉模型接进 Agent 或多步编排前,最好先给这条规则加一个契约测试。
官方公告里的表格同时列出了文本 Agent 和多模态 Agent 项目。图中的数字和脚注都来自 DeepSeek 自己的测试设置,属于官方披露,不是 Mengbi 独立跑出的结果。
官方 benchmark 表格应该怎么读?
DeepSeek 的公告说,新模型保留了 V4-Flash 在 Agent、推理和世界知识方面的文字能力,同时在多模态 Agent 表现上有明显提升。配图把 DeepSeek V4-Flash-Vision-Exp、DeepSeek V4-Flash-0731 和 Opus-4.8 放在一起,既列了文本 Agent 评测,也列了多模态 Agent 评测。
这张表有参考价值,但不能直接当成一张没有前提的总排行榜。脚注写明,代码 Agent 项目使用的是 DeepSeek Harness Minimal Mode,并设定了特定的生成参数;另外两个多模态项目里,纯文本版 V4-Flash 会忽略多模态元素。换句话说,这张图既是在展示分数,也是在展示 DeepSeek 选择的测试方法。
目前最早出现的社区文章,更多是在帮大家快速消化文档。把 384 token 上限、user 角色限制和三种上传方式都提了出来,但它本质上仍是官方文档的整理,不是另一套评测。更早的 和 可以用来了解文字版 V4 Flash 的背景与成本,但它们都早于这次视觉 API 发布,不能拿来证明图片识别效果。
现在最适合拿它做什么?
第一批用例,最好从“图片只是现有文字流程的一个输入”开始:
- 截图分流。 先从错误截图里提取可见文字、按钮名和复现线索,再交给人工确认。
- 图表阅读。 让模型提取标签和变化方向,再追问“这张图不能证明什么”,避免把相关性写成结论。
- 文档审阅。 把需要复核的 PDF 页面渲染成图片,通过 Files API 保存,再让问题和页码一起进入审计记录。
- Agent 观察环节。 让 Agent 看浏览器状态或终端报错,但把执行策略和最后确认留在模型之外。
- 中英文混排的视觉任务。 产品截图、收据、本地数据看板常常同时有中文和英文,这正适合拿来和团队现有的视觉模型做一轮对照。
对 Mengbi 的读者来说,这个变化不意味着要把现有技术栈全部换掉。更现实的做法,是把它当成图片阅读这一步的新候选,尤其适合已经在文字推理或 Agent 调用中使用 DeepSeek 的团队。我们之前的 讨论的是终端和 IDE 工作流;这篇文章聚焦的是“像素如何进入模型”这一层。
第一次接入,按生产思路做小一点
不要一上来就做一个“什么图片都能看”的万能接口。先明确允许的格式、缩放策略、最大尺寸、超时和返回结构。每次结果都保存原图哈希和模型名;如果回答会触发自动动作,再加一层校验或人工确认。
批处理时按用途分流。缩略图和粗分类默认用 low detail;只有小字真的会改变判断时,才切到 high 或 original。也别把一个 30 MiB 的 Base64 请求失败后原样重试三次:如果问题在传输,换成可访问的 URL 或 Files API 往往更有效。
最后,把“模型看到了图”和“模型看对了”分开记录。保存源页面、问题、返回内容和人工修订结果,慢慢积累一份属于自己的评测集。它比一张发布会配图或一串厂商排行榜,更能回答这个模型是否适合你的业务。
DeepSeek V4 Flash Vision-Exp 适合直接上生产吗?
它已经适合做受控实验和可观测的小流程:接口形状明确,限制写得比较清楚,也能接入常见的 OpenAI、Anthropic 适配层。但模型名里还有 -exp,这意味着行为、可用性或价格细节都可能继续调整。
暂时不建议把它作为高风险视觉链路里唯一的模型。拿一小批真实图片和现有供应商并行跑,分别记录 OCR、图表理解、延迟、访问稳定性和人工返工量,再决定要不要扩大范围。真正应该问的不是“它是不是已经比 Opus 好”,而是“在这个具体流程里,它有没有减少成本或麻烦,同时没有悄悄引入新的错误”。
常见问题
DeepSeek 视觉 API 的模型名是什么?
官方模型名是 deepseek-v4-flash-vision-exp。它和文字版 deepseek-v4-flash 是两个不同的模型,Vision 文档也说明其他模型会拒绝图片输入。
可以把本地图片直接传给 DeepSeek 吗?
可以,但不是把电脑上的路径原样放进 JSON。你可以把文件内容转成 Base64 data URL,也可以先通过 Files API 上传,再传回来的 file_id。本地路径本身不是 DeepSeek 能直接访问的公网 URL。
一张图片会消耗多少 token?
DeepSeek Vision 文档写明,图片会按大约 800 × 800 进行 token 计算,每张最多 384 token。这个计费上限不会取消请求体大小和图片像素尺寸的另外两套限制。
Opus-4.8 的对比结果有人独立验证过吗?
本文没有这样声称。这个对比来自 DeepSeek 自己的公告图片和测试设置,应该先按“厂商披露的发布数据”理解,等独立评测给出可复现的测试结果后再下结论。
DeepSeek 视觉 API 支持 Anthropic 的消息格式吗?
支持。DeepSeek 文档提供了兼容 /messages 的接口,并用 image block 表示图片。它和 OpenAI Chat Completions 的字段不同,建议在代码里保留明确的适配层,不要试图用同一个 payload 硬塞两个端点。
来源与核验说明
本文的能力和限制信息,已于 2026 年 8 月 21 日对照 、和 核验。外部观察参考了 、和 。本文没有使用线上 API Key 实际发请求,代码示例来自官方接口形状,正式接入前请用自己的 Key 和图片集验证。
最后核验:2026 年 8 月 21 日。
文中提到的 AI 工具
MENGBI
在做 AI 产品?欢迎聊聊。
想把产品收录到 Mengbi,或者通过一个 API 接入主流 AI 模型,享受更有竞争力的价格?欢迎联系我们。