约 6 分钟阅读

小米 MiMo V2.6 Pro 上线:API 价格、能力与接入指南

小米 MiMo V2.6 Pro 上线:API 价格、能力与接入指南

TL;DR

小米 MiMo V2.6 Pro 已开放 API,支持 1M 上下文和文字、图片、视频、音频输入,输出为文本。普通 Pro 按量计费为每百万 token 输入 3 元、输出 6 元,命中缓存的输入为 0.025 元。复杂任务先试 Pro,日常批量任务对比 Flash;UltraSpeed 单价更高,适合确认有提速需求后再用。

小米 MiMo V2.6 Pro 正式上线了。 小米在 9 月 22 日的公告中确认,Pro 和 Flash 已发布并开放模型权重,API 也已可用。如果你搜到的文章还在说“正在训练,等发布”,那是发布前的信息了。小米发布公告

对准备接入的人来说,最关心的其实很实在:能不能把活干好,一次要花多少钱,现有项目接上去麻不麻烦。我们的建议是,先拿一个经常返工的任务试 Pro,再用 Flash 跑同一份输入。谁交出来的结果少改几遍,谁才更值得用。

本文根据截至 2026 年 9 月 22 日的官方资料和独立评测整理。Mengbi 没有为这篇文章进行付费 API 实测;下面的费用是按公开单价计算的例子,验收方案也会明确作为建议给出。

MiMo V2.6 Pro 的核心规格

项目当前规格
官方 API 模型名mimo-v2.6-pro
上下文窗口1M tokens
最大输出长度128K tokens
输入类型文本、图片、视频、音频
输出类型文本
官方列出的能力深度思考、工具调用、流式输出、结构化输出、缓存、联网搜索
开放权重名称XiaomiMiMo/MiMo-V2.6-Pro-RL
架构与许可MoE;总参数 1.02T、激活参数 42B;MIT 许可

来源:官方模型页小米 Hugging Face 模型卡。下载权重用带 -RL 的名称,调用小米 API 用表里的全小写模型名,别混着填。

这里有个容易误会的地方:能看视频,不等于这个接口直接给你吐出一段视频。 接需求时最好说清楚要交付什么,是带时间点的摘要、分镜脚本、一份代码,还是让其他工具继续处理的指令。交付物明确,验收才有着落。

1M 上下文也不意味着把整个资料库一股脑塞进去就更好。先挑出当前任务要用的文件、截图和证据,保留原始出处。这样结果有问题时,你能查到它依据了什么,也方便同事复核。

API 多少钱:三种版本放在一起算

下面都是小米官方的每百万 token 按量价格,核验日期为 9 月 22 日。人民币和美元各有一套公开价目表,美元栏不是我们临时按汇率换算的。官方 API 定价

实时推理版本缓存命中输入/元未命中输入/元输出/元
Pro0.02536
Flash0.0212
Pro UltraSpeed0.253060
实时推理版本缓存命中输入/美元未命中输入/美元输出/美元
Pro0.00360.4350.87
Flash0.00280.140.28
Pro UltraSpeed0.0364.358.70

Pro 和 Flash 的批量推理,各项 token 单价是对应实时价格的一半;UltraSpeed 不支持批量推理。联网搜索另外收费。Token Plan 订阅额度与按量账户余额也不互通,准备接入前先看清订阅说明,别充了余额却拿错服务的 Key。

跑一次任务,账单大概多少

假设普通 Pro 一次任务读入 10 万个未缓存 token,产生 1 万个计费输出 token

0.1 × 3 元 + 0.01 × 6 元 = 0.36 元

也就是三毛六。按完全相同的用量跑 1,000 次,模型 token 费用是 360 元。这里没算搜索、重试和其他服务;如果思考过程增加了计费输出,就要把那部分也算进去,不能只数最后显示的答案有多长。

再假设这 10 万输入里,有 8 万实际按缓存命中计费,另外 2 万没命中:

0.08 × 0.025 元 + 0.02 × 3 元 + 0.01 × 6 元 = 0.122 元

这个例子说明了缓存可能省在哪,但不代表你的请求一定能命中八成。最后要看实际用量记录,不能凭“我上次也发过这段文字”就按缓存价做预算。

做 Agent 更要把失败的几轮算进去。一次没修好,又读文件、改代码、跑测试,费用都在累加。比较模型时,用“总花费除以验收通过的任务数”更有参考价值,再补上人工检查花的时间。

Pro、Flash、UltraSpeed 怎么选

复杂任务先试 Pro。 比如一个能复现、但总修不干净的 bug,或者需要对照多份资料才能回答的问题。先写好验收条件:哪些测试必须通过,结论要对应哪些原文,最终文件能不能正常打开。模型说“完成了”,还得按这些条件检查。

日常任务让 Flash 先跑一轮。 文档分类、短文本提取、简单修改,都适合拿来和 Pro 对照。两者都过关,就用便宜的;如果 Flash 经常需要追加提示、再跑一遍,也要把这笔返工账算上。

UltraSpeed 适合明确嫌慢的场景。 小米公布的是“最高 20 倍速度”,token 单价则是普通 Pro 的 10 倍。具体到你的任务能快多少,仍然得测。UltraSpeed 官方介绍

有人盯着屏幕等回复,快一点可能很值;凌晨跑一批资料,明早才看结果,就未必需要花这笔钱。测的时候同时看“多久开始给出有用内容”和“整个任务多久完成”。如果时间都耗在测试程序或外部搜索上,文字生成再快,也只解决了一部分等待。

还在跨厂商选型,可以接着看我们的 Grok 4.7 API 指南DeepSeek V4.1 Flash 分析。比较时用同一组任务、同一套验收条件,单看每百万 token 的价格,很容易选偏。

评测分数怎么看,哪些结论别下太早

截至本文核验时,Artificial Analysis 的 MiMo V2.6 Pro 页面显示综合智能指数为 46 分。这是独立评测结果,但不是你业务里的任务成功率。榜单会更新,分数也要连同评测口径一起看。

小米还在模型卡公布了下面这组数据。这部分属于厂商报告,Mengbi 没有自行复测。

评测项目V2.6 ProV2.6 FlashV2.5 Pro
DeepSWE v1.171.967.919.0
ProgramBench26.526.012.5
Toolathlon-Verified76.973.649.1

这张表适合横着看,同一项目对比不同模型。不同项目的分数不能直接相加,也不能换算成“整体强了几倍”。它给出的信号是:新版本值得放进代码和工具调用任务里试一试。至于你手头那个项目能不能一次改对,榜单替你回答不了。

写代码就检查原来的问题有没有解决、其他功能有没有被改坏;整理资料就抽查数字和引用。答案排版再漂亮,夹了一个不存在的来源,同事照样得花时间返工。

这次发布还强调强化学习。通俗地说,就是训练时让模型做任务,根据反馈继续调整。这里说的是训练方法,不能据此理解为“你跟它聊一会儿,它就会在线重练自己的模型参数”。

MiMo V2.6 Pro API 接入示例

  1. 在小米开放平台创建 API Key。下面的示例使用按量计费服务。
  2. 执行 pip install openai,安装 Python 客户端。
  3. 在环境变量里设置 MIMO_API_KEY。密钥放在服务端,不要写进前端页面或提交到仓库。
  4. 先跑一个短请求,确认接通,再接入自己的 Agent。
python
import osfrom openai import OpenAI
client = OpenAI(    api_key=os.environ["MIMO_API_KEY"],    base_url="https://api.xiaomimimo.com/v1",)
response = client.chat.completions.create(    model="mimo-v2.6-pro",    messages=[{        "role": "user",        "content": "给 CSV 导入功能列出三条可操作的验收标准。",    }],    max_completion_tokens=1024,    extra_body={"thinking": {"type": "disabled"}},)
print(response.choices[0].message.content)print(response.usage)

示例遵循官方 OpenAI 兼容格式,先关闭思考,用短请求检查连接。本文已检查代码语法,没有用付费账户实际调用。处理复杂推理时,可以把 thinking.type 改为 enabled,并给足输出预算。深度思考文档

官方默认开启思考。max_completion_tokens 限制的是思考加最终回答的总长度,设得太小,可能前面想了很久,最后答案却被截断。思考模式还会把 temperaturetop_p 固定为推荐值 1.0、0.95;旧客户端如果自己设过这些参数,迁移时要留意。

接工具调用时,要把整轮流程跑通:模型发出工具请求,你的程序执行,再把结果交回去。官方 Chat Completions 文档要求,多轮思考工具调用的历史中保留 reasoning_content。有些封装会顺手删掉“不认识的字段”,这里就可能出问题。

改好 Base URL,只代表接入迈出了第一步。流式输出能不能正确拼接、JSON 能不能通过校验、失败会不会重复执行工具,都要在实际使用的客户端里检查。还没选好编程工具,可以参考我们的 AI 编程 Agent 对比

开源部署,以及 V2.5 用户的迁移提醒

小米已在 Hugging Face 发布 MIT 许可的 Pro-RL 权重。规格中的 42B 是每个 token 激活的参数规模,模型总参数仍是 1.02T。做部署预算时,别把它当成一个独立的 42B 小模型来估算。具体部署要参考模型卡,并按实际上下文长度和并发量测内存占用。

如果团队还没有模型推理服务,先用 API 判断它能不能解决问题更直接。自己部署需要考虑权重存储、加速卡、推理框架和日常维护。权重可以下载,与“运行起来不花钱”是两回事。

已经在用 V2.5 的读者,还有一个明确的时间点:mimo-v2.5-promimo-v2.5 将于北京时间 2026 年 10 月 21 日 10:00 下线。 这是小米价格页列出的通知,建议提前安排迁移。官方下线提醒

原来的 V2.5 Pro 任务,可以先测试 mimo-v2.6-pro;使用 mimo-v2.5 的任务,则可以评估 mimo-v2.6-flash。第一轮尽量保留原提示词,方便判断哪些变化来自模型,之后再针对实际问题调整。

先切一小部分任务,观察通过率、费用、耗时和错误。也要在旧模型下线前选好仍然可用的备用方案,别等出故障才发现,原本准备切回去的型号也已经停了。

上线前,拿这些真实任务验收

挑一组团队熟悉的任务,既有简单的,也有难的,再放几个以前出过错的例子。下面是我们建议的验收方式,不是本文已经跑出的测试成绩。

任务看什么才算过关记哪些成本
修复仓库 bug复现用例通过,原有测试不被破坏所有尝试和人工审查时间
提取文档字段必填项齐全,字段值与原文一致每条合格记录的总 token
理解界面截图文字和位置判断准确,不编造按钮给出可用答案的等待时间
整理录音内容与录音一致,听不清的地方有标记输入处理和人工纠错成本
完成工具流程参数正确、结果回传完整、产物可用调用次数、重试和总耗时

验收标准先定好,再看是哪款模型给出的答案。失败的记录别删,需要人工重写的也如实记下来。这样选出来的模型,才更接近你每天实际用起来的感受。

我们的建议很简单:先挑一个经常让你返工的活,让 Pro 和 Flash 各做一次,认真检查交付物,再决定下一步扩大到哪些任务。想对照更复杂工作场景的选型思路,也可以继续看 GPT-6 Astra API 指南

常见问题

MiMo V2.6 Pro 现在能用了吗?

能。小米 2026 年 9 月 22 日的公告已确认上线。官方 API 模型名是 mimo-v2.6-pro,开放权重使用另一个名称 MiMo-V2.6-Pro-RL

MiMo V2.6 Pro API 怎么收费?

普通 Pro 国内按量价格为每百万 token:未缓存输入 3 元、输出 6 元、缓存命中输入 0.025 元。搜索、重试和所选服务会影响最终费用。

MiMo V2.6 Pro 开源了,是不是就能免费用?

小米提供 MIT 许可的开放权重,但官方 API 有明确价格,自己运行也需要硬件和运维。是否有免费体验,要看你使用的具体服务和账户活动。

能看图片、听音频、理解视频吗?

能。小米中文模型页和模型卡都列出了这些输入类型。模型输出为文本,若要生成视频或音频文件,还需要相应工具和处理流程。

Pro、Flash 和 UltraSpeed 应该选哪个?

难任务先试 Pro,日常高频任务对比 Flash。UltraSpeed 单价更高,先确认实际等待时间影响了使用体验,再测提速值不值这笔钱。

V2.5 什么时候下线?

小米列出的时间是北京时间 2026 年 10 月 21 日 10:00,涉及 mimo-v2.5-promimo-v2.5。建议提前验证新模型及备用方案。

资料核验说明

价格和接入细节均在相关段落附有官方来源;评测部分标明了独立机构与厂商各自公布的数据。费用算例和上线建议由 Mengbi 根据这些资料整理。

最后更新:2026 年 9 月 22 日。文中资料于当天核验,价格、可用范围和实时榜单可能继续调整。

MENGBI

在做 AI 产品?欢迎聊聊。

想把产品收录到 Mengbi,或者通过一个 API 接入主流 AI 模型,享受更有竞争力的价格?欢迎联系我们。