约 4 分钟阅读

DeepSeek V4.1 Flash 测评:速度、价格与 V4 / Pro 对比

DeepSeek V4.1 Flash 测评:速度、价格与 V4 / Pro 对比

TL;DR

DeepSeek V4.1 Flash 适合进入文本与图片任务的对照测试,但现阶段不能仅凭速度宣传替换生产模型。AIHubMix 已列出内测入口,其 token 报价与同平台 V4 Flash 一致;V4.1 的独立质量评测仍不足。V4 Flash 0731、V4 Pro 和 Vision-Exp 应作为不同任务的比较基线。

DeepSeek V4.1 Flash 值得试,但还没有足够证据证明它能全面替代 V4 Pro。它最值得关注的是图片输入和早期速度表现。已提供测试入口,同时明确说明这是内测版本,不建议用于生产。

本文是一篇基于公开证据的早期测评解读,不是 Mengbi 自行调用 API 完成的实测报告。我们于 2026 年 9 月 8 日核查了官方文档、供应商页面和独立评测页面,没有执行付费 API 跑分。不同版本、供应商和测试任务的数据会分别标注。

封面为 Mengbi 使用 AI 生成的蓝白风格原创编辑插图,非 DeepSeek 官方 V4.1 发布图。

DeepSeek V4.1 Flash 与 V4 Flash、Pro 怎么选?

文本和代码任务优先与 V4 Flash 0731 比较,复杂推理和多步骤任务再看 Pro。处理截图或文档图片时,应加入 Vision-Exp,而不是让文本模型承担不支持的输入。

模型当前可核查的证据适合承担的比较角色
V4.1 Flash 内测版供应商目录与服务指标,独立质量证据不足更快文本与图片工作流的候选模型
V4 Flash 0731官方更新日志、独立评测页面现有文本与编程任务的基线
V4 Pro 八月版本官方发布说明与厂商 Agent 评测高难度、多步骤任务的基线
V4 Flash Vision-Exp官方视觉文档与实验版说明有明确文档的图片输入基线

分别记录了七月 Flash 更新、八月 Pro 更新和八月 Vision-Exp 发布。核查时,该页面尚未出现 V4.1 条目。这不能证明内测不存在,但意味着不能把供应商参数写成已获官方技术文档确认的规格。

内测入口确认了什么?还有什么未知?

AIHubMix 的页面列出了 deepseek-v4.1-flash,标注文本和图片输入,并展示包含 deepseek-v4.1-flash-expires-on-0910 的上游标识。这个带日期的名称应视为临时入口,不能当作长期生产承诺,也不能据此推定准确的关停时刻。

接入时必须区分供应商别名与官方模型名。使用 AIHubMix 的 Key 和 Base URL,就应遵循它的调用示例;不要把短别名直接填入其他平台,并假定会得到同一模型。

供应商介绍提到新架构与原生多模态,但我们没有核实到公开的 V4.1 技术报告、模型权重或完整模态规范。尤其不能从“多模态”推导出音频、视频支持,也不能把 V4 的参数量与许可证沿用到 V4.1。

需要先接通有文档可查的图片工作流,可以参考。该指南对应另一个实验模型,其上传限制不自动适用于 V4.1。

速度测评:服务指标有潜力,但不等于受控跑分

区分首 token 时间和输出吞吐量,并说明数据为平台实测滚动均值。调研期间,一个公开快照显示 V4.1 为 192.9 tokens/s,Flash 0731 为 96.7 tokens/s;这些数值会随流量变化。

AIHubMix 正式对比界面中的 DeepSeek V4 Flash 0731 与 V4.1 Flash 价格和规格

9 月 8 日截取的 AIHubMix 真实页面。这是商业供应商界面,不是独立质量排行榜;截图记录价格和规格,实时测速可能与调研快照不同。

两个显示均值的比值约为 2.0 倍,但它不是同题同参数的性能提升结论。页面未为这组汇总值提供配对题集、推理预算或样本量。长输出还会摊薄启动延迟,因此每秒生成更多 token,不一定意味着短问答更快完成。

作为独立参照,在核查时显示约 128 tokens/s。页面明确标注的是 Flash 0731、推理模式、max 档位,不是 V4.1。当前 Intelligence Index 使用 v4.3,不应与旧版指数的截图直接比较。

Artificial Analysis 正式评测页面,型号明确标注为旧版 DeepSeek V4 Flash 0731

9 月 8 日截取的 Artificial Analysis 实际界面。型号本身就是证据边界:这张图展示旧版 Flash 基线,不是 V4.1 的得分。

因此,目前不能断言 V4.1 的答案质量超过 Pro,也不能说 Agent 任务完成时间缩短了一半。生成错误补丁再快,也会消耗代码审查时间。讨论了模型之外的终端与 IDE 工作流。

API 价格:比较完成一项任务的成本

9 月 8 日核查时,AIHubMix 对两条 Flash 路由均列出每百万输入 token 0.142 美元、输出 0.284 美元,缓存读取为每百万 token 0.0284 美元。这是 AIHubMix 报价,不是经过核实的 DeepSeek 官方直连账单。充值前请再看

举一个不使用缓存、不调用额外服务的文本任务:输入 10,000 token,输出 2,000 token。按上述单价计算,费用为 0.01 × 0.142 + 0.002 × 0.284 = 0.001988 美元。1,000 次相同请求为 1.988 美元,不包含重试或其他计费用量。这是预算示例,不是真实账单。

token 单价相同,不代表每个合格答案的成本相同。推理 token、工具重试和人工纠错都可能改变结果。比较时同时记录总计费用量和通过验收的任务数;第一次回答便宜,但需要反复修正,成本优势就可能消失。

从 Flash 或 Pro 切换前,该做哪些测试?

建议先用团队已经熟悉的真实任务做一组小规模、可重复的评估。下面是建议方案,不是我们已经执行的实验。

  1. 选代表任务。 包含有自动测试的 bug 修复、答案字段已知的文档提取、存在歧义的问题和带小字号标签的截图。图片任务只与支持图片输入的模型比较。
  2. 固定环境。 记录供应商、完整模型名、提示词、输入长度、推理档位、输出上限和工具版本。所有候选模型使用相同文件与验收规则。
  3. 重复运行并保留失败。 分别记录首 token 延迟、完整回答时间和工具执行时间。报告中位数与慢请求情况,不只选择最快一次。
  4. 统计合格交付。 记录测试通过率、字段准确性、无依据断言、人工纠错时间和总计费 token。速度与正确率分列,避免互相掩盖。
  5. 保留回退。 用配置控制内测模型,设置超时、有限重试和已验证的替代模型。入口名称带有日期,定时任务执行前还应确认可用性。

编程助手要回答的是“正确补丁能否更早交付”;文档处理要回答的是“在实际输入长度下,提取是否可靠”。同一个模型处理这两类任务,也需要不同的验收标准。提供了另一种可纳入同一测试方案的候选模型。

结论:值得试用,先保留质量基线

如果工作流的大量时间花在等待文本生成,或者图片理解能减少模型之间的转接,V4.1 Flash 值得进入评估名单。供应商入口已经足够具体,可以规划试用;但现有证据不足以支持“全面超过 V4 Pro”的判断。

保留 Flash 0731 作为文本基线,保留 Pro 处理已验证的难题;图片任务则可参考有的 Vision-Exp。只有当验收率、端到端时间和每项合格任务的成本同时满足目标,再逐步扩大 V4.1 的使用范围。

常见问题

DeepSeek V4.1 Flash 已经正式发布了吗?

目前有公开列出的测试入口,但截至 9 月 8 日,我们没有在 DeepSeek 公开更新日志中找到 V4.1 发布条目。AIHubMix 将其标注为内测并建议仅测试使用。供应商可调用不等同于正式通用发布。

V4.1 Flash 比 V4 Flash 0731 快多少?

调研时 AIHubMix 的滚动服务指标显示 V4.1 输出吞吐量更高,但没有披露匹配题集和样本量。不能把两个页面均值的比值当作任务加速保证。应使用自己的提示词测量完整任务时间和正确率。

V4.1 Flash 支持图片、视频和音频吗?

AIHubMix 目录列出文本和图片输入、文本输出。我们尚未核实 V4.1 专属的官方视频或音频规范,不能从“原生多模态”推定具体支持范围。

V4.1 Flash 能替代 DeepSeek V4 Pro 吗?

某些任务可能适合,但目前没有足够证据证明它能全面替代 Pro。先比较高难度案例、长对话和工具错误处理,在达到质量与可用性要求前保留 Pro。

最后更新:2026 年 9 月 8 日。供应商价格与性能页面可能变化;本文没有执行 Mengbi 自有 API 跑分。

文中提到的 AI 工具

MENGBI

在做 AI 产品?欢迎聊聊。

想把产品收录到 Mengbi,或者通过一个 API 接入主流 AI 模型,享受更有竞争力的价格?欢迎联系我们。