小米 MiMo V2.6 Pro 正式上线了。 小米在 9 月 22 日的公告中确认,Pro 和 Flash 已发布并开放模型权重,API 也已可用。如果你搜到的文章还在说“正在训练,等发布”,那是发布前的信息了。小米发布公告。
对准备接入的人来说,最关心的其实很实在:能不能把活干好,一次要花多少钱,现有项目接上去麻不麻烦。我们的建议是,先拿一个经常返工的任务试 Pro,再用 Flash 跑同一份输入。谁交出来的结果少改几遍,谁才更值得用。
本文根据截至 2026 年 9 月 22 日的官方资料和独立评测整理。Mengbi 没有为这篇文章进行付费 API 实测;下面的费用是按公开单价计算的例子,验收方案也会明确作为建议给出。
MiMo V2.6 Pro 的核心规格
| 项目 | 当前规格 |
|---|---|
| 官方 API 模型名 | mimo-v2.6-pro |
| 上下文窗口 | 1M tokens |
| 最大输出长度 | 128K tokens |
| 输入类型 | 文本、图片、视频、音频 |
| 输出类型 | 文本 |
| 官方列出的能力 | 深度思考、工具调用、流式输出、结构化输出、缓存、联网搜索 |
| 开放权重名称 | XiaomiMiMo/MiMo-V2.6-Pro-RL |
| 架构与许可 | MoE;总参数 1.02T、激活参数 42B;MIT 许可 |
来源:官方模型页、小米 Hugging Face 模型卡。下载权重用带 -RL 的名称,调用小米 API 用表里的全小写模型名,别混着填。
这里有个容易误会的地方:能看视频,不等于这个接口直接给你吐出一段视频。 接需求时最好说清楚要交付什么,是带时间点的摘要、分镜脚本、一份代码,还是让其他工具继续处理的指令。交付物明确,验收才有着落。
1M 上下文也不意味着把整个资料库一股脑塞进去就更好。先挑出当前任务要用的文件、截图和证据,保留原始出处。这样结果有问题时,你能查到它依据了什么,也方便同事复核。
API 多少钱:三种版本放在一起算
下面都是小米官方的每百万 token 按量价格,核验日期为 9 月 22 日。人民币和美元各有一套公开价目表,美元栏不是我们临时按汇率换算的。官方 API 定价。
| 实时推理版本 | 缓存命中输入/元 | 未命中输入/元 | 输出/元 |
|---|---|---|---|
| Pro | 0.025 | 3 | 6 |
| Flash | 0.02 | 1 | 2 |
| Pro UltraSpeed | 0.25 | 30 | 60 |
| 实时推理版本 | 缓存命中输入/美元 | 未命中输入/美元 | 输出/美元 |
|---|---|---|---|
| Pro | 0.0036 | 0.435 | 0.87 |
| Flash | 0.0028 | 0.14 | 0.28 |
| Pro UltraSpeed | 0.036 | 4.35 | 8.70 |
Pro 和 Flash 的批量推理,各项 token 单价是对应实时价格的一半;UltraSpeed 不支持批量推理。联网搜索另外收费。Token Plan 订阅额度与按量账户余额也不互通,准备接入前先看清订阅说明,别充了余额却拿错服务的 Key。
跑一次任务,账单大概多少
假设普通 Pro 一次任务读入 10 万个未缓存 token,产生 1 万个计费输出 token:
0.1 × 3 元 + 0.01 × 6 元 = 0.36 元
也就是三毛六。按完全相同的用量跑 1,000 次,模型 token 费用是 360 元。这里没算搜索、重试和其他服务;如果思考过程增加了计费输出,就要把那部分也算进去,不能只数最后显示的答案有多长。
再假设这 10 万输入里,有 8 万实际按缓存命中计费,另外 2 万没命中:
0.08 × 0.025 元 + 0.02 × 3 元 + 0.01 × 6 元 = 0.122 元
这个例子说明了缓存可能省在哪,但不代表你的请求一定能命中八成。最后要看实际用量记录,不能凭“我上次也发过这段文字”就按缓存价做预算。
做 Agent 更要把失败的几轮算进去。一次没修好,又读文件、改代码、跑测试,费用都在累加。比较模型时,用“总花费除以验收通过的任务数”更有参考价值,再补上人工检查花的时间。
Pro、Flash、UltraSpeed 怎么选
复杂任务先试 Pro。 比如一个能复现、但总修不干净的 bug,或者需要对照多份资料才能回答的问题。先写好验收条件:哪些测试必须通过,结论要对应哪些原文,最终文件能不能正常打开。模型说“完成了”,还得按这些条件检查。
日常任务让 Flash 先跑一轮。 文档分类、短文本提取、简单修改,都适合拿来和 Pro 对照。两者都过关,就用便宜的;如果 Flash 经常需要追加提示、再跑一遍,也要把这笔返工账算上。
UltraSpeed 适合明确嫌慢的场景。 小米公布的是“最高 20 倍速度”,token 单价则是普通 Pro 的 10 倍。具体到你的任务能快多少,仍然得测。UltraSpeed 官方介绍。
有人盯着屏幕等回复,快一点可能很值;凌晨跑一批资料,明早才看结果,就未必需要花这笔钱。测的时候同时看“多久开始给出有用内容”和“整个任务多久完成”。如果时间都耗在测试程序或外部搜索上,文字生成再快,也只解决了一部分等待。
还在跨厂商选型,可以接着看我们的 Grok 4.7 API 指南和 DeepSeek V4.1 Flash 分析。比较时用同一组任务、同一套验收条件,单看每百万 token 的价格,很容易选偏。
评测分数怎么看,哪些结论别下太早
截至本文核验时,Artificial Analysis 的 MiMo V2.6 Pro 页面显示综合智能指数为 46 分。这是独立评测结果,但不是你业务里的任务成功率。榜单会更新,分数也要连同评测口径一起看。
小米还在模型卡公布了下面这组数据。这部分属于厂商报告,Mengbi 没有自行复测。
| 评测项目 | V2.6 Pro | V2.6 Flash | V2.5 Pro |
|---|---|---|---|
| DeepSWE v1.1 | 71.9 | 67.9 | 19.0 |
| ProgramBench | 26.5 | 26.0 | 12.5 |
| Toolathlon-Verified | 76.9 | 73.6 | 49.1 |
这张表适合横着看,同一项目对比不同模型。不同项目的分数不能直接相加,也不能换算成“整体强了几倍”。它给出的信号是:新版本值得放进代码和工具调用任务里试一试。至于你手头那个项目能不能一次改对,榜单替你回答不了。
写代码就检查原来的问题有没有解决、其他功能有没有被改坏;整理资料就抽查数字和引用。答案排版再漂亮,夹了一个不存在的来源,同事照样得花时间返工。
这次发布还强调强化学习。通俗地说,就是训练时让模型做任务,根据反馈继续调整。这里说的是训练方法,不能据此理解为“你跟它聊一会儿,它就会在线重练自己的模型参数”。
MiMo V2.6 Pro API 接入示例
- 在小米开放平台创建 API Key。下面的示例使用按量计费服务。
- 执行
pip install openai,安装 Python 客户端。 - 在环境变量里设置
MIMO_API_KEY。密钥放在服务端,不要写进前端页面或提交到仓库。 - 先跑一个短请求,确认接通,再接入自己的 Agent。
示例遵循官方 OpenAI 兼容格式,先关闭思考,用短请求检查连接。本文已检查代码语法,没有用付费账户实际调用。处理复杂推理时,可以把 thinking.type 改为 enabled,并给足输出预算。深度思考文档。
官方默认开启思考。max_completion_tokens 限制的是思考加最终回答的总长度,设得太小,可能前面想了很久,最后答案却被截断。思考模式还会把 temperature 和 top_p 固定为推荐值 1.0、0.95;旧客户端如果自己设过这些参数,迁移时要留意。
接工具调用时,要把整轮流程跑通:模型发出工具请求,你的程序执行,再把结果交回去。官方 Chat Completions 文档要求,多轮思考工具调用的历史中保留 reasoning_content。有些封装会顺手删掉“不认识的字段”,这里就可能出问题。
改好 Base URL,只代表接入迈出了第一步。流式输出能不能正确拼接、JSON 能不能通过校验、失败会不会重复执行工具,都要在实际使用的客户端里检查。还没选好编程工具,可以参考我们的 AI 编程 Agent 对比。
开源部署,以及 V2.5 用户的迁移提醒
小米已在 Hugging Face 发布 MIT 许可的 Pro-RL 权重。规格中的 42B 是每个 token 激活的参数规模,模型总参数仍是 1.02T。做部署预算时,别把它当成一个独立的 42B 小模型来估算。具体部署要参考模型卡,并按实际上下文长度和并发量测内存占用。
如果团队还没有模型推理服务,先用 API 判断它能不能解决问题更直接。自己部署需要考虑权重存储、加速卡、推理框架和日常维护。权重可以下载,与“运行起来不花钱”是两回事。
已经在用 V2.5 的读者,还有一个明确的时间点:mimo-v2.5-pro 和 mimo-v2.5 将于北京时间 2026 年 10 月 21 日 10:00 下线。 这是小米价格页列出的通知,建议提前安排迁移。官方下线提醒。
原来的 V2.5 Pro 任务,可以先测试 mimo-v2.6-pro;使用 mimo-v2.5 的任务,则可以评估 mimo-v2.6-flash。第一轮尽量保留原提示词,方便判断哪些变化来自模型,之后再针对实际问题调整。
先切一小部分任务,观察通过率、费用、耗时和错误。也要在旧模型下线前选好仍然可用的备用方案,别等出故障才发现,原本准备切回去的型号也已经停了。
上线前,拿这些真实任务验收
挑一组团队熟悉的任务,既有简单的,也有难的,再放几个以前出过错的例子。下面是我们建议的验收方式,不是本文已经跑出的测试成绩。
| 任务 | 看什么才算过关 | 记哪些成本 |
|---|---|---|
| 修复仓库 bug | 复现用例通过,原有测试不被破坏 | 所有尝试和人工审查时间 |
| 提取文档字段 | 必填项齐全,字段值与原文一致 | 每条合格记录的总 token |
| 理解界面截图 | 文字和位置判断准确,不编造按钮 | 给出可用答案的等待时间 |
| 整理录音 | 内容与录音一致,听不清的地方有标记 | 输入处理和人工纠错成本 |
| 完成工具流程 | 参数正确、结果回传完整、产物可用 | 调用次数、重试和总耗时 |
验收标准先定好,再看是哪款模型给出的答案。失败的记录别删,需要人工重写的也如实记下来。这样选出来的模型,才更接近你每天实际用起来的感受。
我们的建议很简单:先挑一个经常让你返工的活,让 Pro 和 Flash 各做一次,认真检查交付物,再决定下一步扩大到哪些任务。想对照更复杂工作场景的选型思路,也可以继续看 GPT-6 Astra API 指南。
常见问题
MiMo V2.6 Pro 现在能用了吗?
能。小米 2026 年 9 月 22 日的公告已确认上线。官方 API 模型名是 mimo-v2.6-pro,开放权重使用另一个名称 MiMo-V2.6-Pro-RL。
MiMo V2.6 Pro API 怎么收费?
普通 Pro 国内按量价格为每百万 token:未缓存输入 3 元、输出 6 元、缓存命中输入 0.025 元。搜索、重试和所选服务会影响最终费用。
MiMo V2.6 Pro 开源了,是不是就能免费用?
小米提供 MIT 许可的开放权重,但官方 API 有明确价格,自己运行也需要硬件和运维。是否有免费体验,要看你使用的具体服务和账户活动。
能看图片、听音频、理解视频吗?
能。小米中文模型页和模型卡都列出了这些输入类型。模型输出为文本,若要生成视频或音频文件,还需要相应工具和处理流程。
Pro、Flash 和 UltraSpeed 应该选哪个?
难任务先试 Pro,日常高频任务对比 Flash。UltraSpeed 单价更高,先确认实际等待时间影响了使用体验,再测提速值不值这笔钱。
V2.5 什么时候下线?
小米列出的时间是北京时间 2026 年 10 月 21 日 10:00,涉及 mimo-v2.5-pro 和 mimo-v2.5。建议提前验证新模型及备用方案。
资料核验说明
价格和接入细节均在相关段落附有官方来源;评测部分标明了独立机构与厂商各自公布的数据。费用算例和上线建议由 Mengbi 根据这些资料整理。
最后更新:2026 年 9 月 22 日。文中资料于当天核验,价格、可用范围和实时榜单可能继续调整。

