约 4 分钟阅读

GPT-6 Sol 和 Luna 值得换吗?价格、跑分与真实使用反馈

GPT-6 Sol 和 Luna 值得换吗?价格、跑分与真实使用反馈

TL;DR

GPT-6 Sol 更适合复杂编码和多步任务,Luna 适合量大、目标明确的工作。两者最确定的变化是 API 价格下降:短上下文 Standard 档每百万输入/输出 token,Sol 为 2/10 美元,Luna 为 0.10/0.50 美元。OpenAI 公布了更好的内部评测结果,但第三方跑分尚不足以证明所有任务都明显变强。已有工作流建议先做小规模 A/B 测试,再决定是否全量切换。

GPT-6 Sol 与 Luna 主题封面。产品信息以文中链接的官方资料为准。

GPT-6 Sol 和 Luna 已经发布,值得马上换吗?如果你在意 API 账单,值得认真看;如果你期待“换个模型就能少审代码、少核事实”,目前的证据还撑不起这个结论。Sol 面向复杂编程和多步工作,Luna 面向摘要、提取、分类等量大且目标明确的任务。本文核对了 OpenAI 发布博客官方价格页Artificial Analysis 的独立对比,把“官方说变强了”和“外部实际测到什么”分开讲。

先说清楚测评范围:Mengbi 没有自行调用两款 API 做同题盲测。下面的“使用反馈”来自可追溯的第三方测试和公开报道;选型建议是基于这些资料的判断,不是本站实测成绩。资料核验于 2026 年 9 月 23 日。新模型上线初期,价格、可用范围和第三方榜单都可能调整。

GPT-6 Sol 和 Luna 有什么区别?

选择更合适的任务需要留意
GPT-6 Sol跨文件改代码、复杂分析、需要多轮工具调用的 Agent输出和推理 token 可能推高整单费用;关键结果仍要验收
GPT-6 Luna摘要、资料提取、分类、批量问答和低成本子任务遇到复杂约束、长链路和高代价错误时,最好有复核步骤
GPT-6 Astra最难且容错低的任务能力档位更高,单价也明显更高

这是根据 OpenAI 的模型定位给出的工作分配建议,不代表 Luna 完全不能写代码,也不代表 Sol 对每项任务都更划算。OpenAI 的 SolLuna模型页均列出 1,050,000 token 上下文窗口、128,000 token 最大输出,支持文本与图片输入、文本输出。长上下文是容量上限,实际请求一旦超过 272K 输入 token,适用的计费档位会上升。

GPT-6 Sol、Luna 价格:便宜了多少?

截至 9 月 23 日,OpenAI API Standard、短上下文的每百万 token 列表价如下。价格只含模型 token,不含网页搜索、计算机使用等按次工具费用,也不等于 ChatGPT 订阅价。

模型输入缓存输入输出
GPT-6 Sol2 美元0.20 美元10 美元
GPT-6 Luna0.10 美元0.01 美元0.50 美元
GPT-6 Astra10 美元1 美元50 美元

这些数字来自 OpenAI API 价格表。对照 发布博客列出的旧促销价,Sol 的输入从 4 美元降至 2 美元、输出从 20 美元降至 10 美元;Luna 的输入从 0.20 美元降至 0.10 美元、输出从 1.20 美元降至 0.50 美元。后一项降幅约 58%,所以不宜把每个计费项都笼统写成“刚好腰斩”。

算一笔简单账:假设一次请求用 10 万未缓存输入 token + 1 万输出 token,短上下文 Standard 档的理论模型费,Sol 是 0.1 × 2 + 0.01 × 10 = 0.30 美元,Luna 是 0.1 × 0.10 + 0.01 × 0.50 = 0.015 美元。实际还要加上缓存写入、工具调用和失败重试;超过 272K 输入时,也不能继续套用这张短上下文价表。采购时更该看“每个成功任务花了多少钱”,而不是只看单价。

官方跑分好看,能直接信吗?

OpenAI 在发布文中给出了几个值得关注的结果:内部事实性评估里,Sol 的错误次数约为 GPT-5.6 Sol 的一半DeepSWE 1.1上,Sol max 为 68.8%、Luna max 为 66.6%OSWorld 2.0离线集里,Sol xhigh 为 60.5%。这些都是厂商按指定配置报告的成绩,不能直接推导出“你自己的项目 bug 少一半”或“Luna 能独立交付复杂功能”。

尤其要看脚注。OpenAI 说,事实性样本来自用户曾标记错误的匿名对话,这类对话并不代表日常使用;竞品分数取自公开报告,不一定与 OpenAI 模型处于完全相同的运行环境。它也提醒研究环境/API 的输出可能与生产 ChatGPT 不同。因此,官方图表更适合用来挑选待测试的场景,不能替代你的验收集。

第三方测评和媒体反馈:哪些结论更稳?

Artificial Analysis 的 Sol high 与 Luna high 对比在其 Intelligence Index v4.3.2 上分别给出 43 和 32。同一页显示,Luna 的加权平均任务成本约 0.03 美元,Sol 约 0.37 美元。这里的“每任务”是该机构评测任务及权重下的数值,不是你的客服工单或代码 PR 的固定报价。两款模型的推理档位都设为 high;换成 max、不同提示词或不同工具栈,结果未必一样。

这个对比支持一个朴素判断:Luna 便宜很多,但面对同一组复杂题,能力也有差距。它没有证明新款一定全面超过各自的 GPT-5.6 前代,更不能证明 Sol 比所有竞品强。第三方榜单也会随着版本和测量方法更新,引用时要保留日期、推理档位和指标名。

TechCrunch 的发布报道也把降价与厂商宣称的事实性改善放在一起讨论,并指出后者仍是 OpenAI 的说法。它是一篇新闻核对与市场观察,不是独立同题实测。网上关于“Luna 比上一代还差”或“Sol 已经全面碾压”的短帖可以作为问题线索,但没有稳定样本和完整复现条件,不适合写进结论。

真要换模型,怎么测才不白花钱?

如果你现在用 GPT-5.6,先从业务里抽 20–50 个已经知道标准答案的任务,把输入、工具、推理档位和超时条件固定,再让旧版、Sol、Luna 跑同一批任务。这个样本数是试点建议,并非统计显著性保证。至少记录四项:一次通过率、人工返工时间、端到端耗时和含重试的总账单

  • 写代码:检查测试是否通过、修改范围有没有跑偏、能否直接进入人工 review。复杂 PR 可以让 Luna 做资料整理,再让 Sol 执行或复核;高风险变更仍需人工验收。
  • 内容和资料处理:让 Luna 做批量提取与初稿,抽样检查遗漏和错引。格式正确不等于事实正确。
  • Agent 工作流:单独统计工具调用、缓存命中与失败重试。提示词或工具清单变化后,旧缓存和旧账单经验可能不再适用;OpenAI 介绍了 GPT-6 的缓存改进,但你自己的命中率仍需实测。

还没搞清当前模型能否完成任务时,先别急着换。若旧模型已经稳定、复核成本低,降价可能是直接收益;若任务成败取决于少数边界条件,就先跑回归集,再看换代收益是否超过迁移成本。

常见问题

GPT-6 Sol 和 Luna 哪个更适合编程?

复杂编码与多步 Agent 任务先试 Sol;清晰、重复、可自动验收的子任务可以试 Luna。OpenAI 的 DeepSWE 成绩说明 Luna 并非“不能写代码”,但官方评测也不能替代你仓库的测试和 review。要了解更高能力档位,可看本站的 GPT-6 Astra API 分析

GPT-6 Sol 和 Luna 在 ChatGPT 里都能用吗?

OpenAI 发布时的说明是:Plus、Pro、Business、Enterprise、Edu 可在 ChatGPT Work 和 Codex 使用两款模型;Free、Go 可在桌面端使用 Luna。普通 Chat 的开放节奏不同,发布时尚未上线,之后应以你账号的模型选择器和官方更新为准。

API 应该用什么模型名?

分别是 gpt-6-solgpt-6-luna。两款都可走 Responses API;如果要接工具,先核对各自官方模型页支持的接口、工具与 reasoning 设置。长上下文、缓存写入和不同处理档位会影响最后账单。

结论

这次最确定的升级价值是成本空间变大,能力提升需要按场景核实。Sol 可以作为复杂工作的默认候选,Luna 值得进入量大、可复核的流程;别因一张跑分图就把所有请求统一切换。先用真实任务做小规模对照,保留验收和回滚,再决定流量怎么分。

资料来源与口径:OpenAI 发布博客(发布与厂商评测)、OpenAI API 价格(2026 年 9 月 23 日核验)、Artificial Analysis 模型对比(独立测量,high 档)、TechCrunch 报道(媒体观察)。

MENGBI

在做 AI 产品?欢迎聊聊。

想把产品收录到 Mengbi,或者通过一个 API 接入主流 AI 模型,享受更有竞争力的价格?欢迎联系我们。