约 6 分钟阅读

Claude Opus 5.5 发布:价格、测评与升级前要检查的事

Claude Opus 5.5 发布:价格、测评与升级前要检查的事

TL;DR

Claude Opus 5.5 于 2026 年 9 月 22 日发布,支持 100 万 Token 上下文,标准最大输出为 12.8 万 Token。官方 API 输入、输出价格分别为每百万 Token 4 美元和 20 美元,缓存读取为 0.20 美元。Artificial Analysis 在最高推理档位、启用默认回退模型的配置下给出约 58 分。它值得用真实项目试一轮,但升级前需检查思考参数、工具调用和对话历史兼容性。

Claude Opus 5.5 已经发布。 Anthropic 在 9 月 22 日的官方公告中,把重点放在三件日常工作真正用得上的事:复杂任务做得更好,调用成本更低,回复更容易看懂。

如果你每天让 Claude 改代码、读资料、写方案,这次更新值得认真看。最直观的变化是 API 输入和输出单价都降了 20%;更值得验证的,则是它能否少走弯路,让你少花时间盯着它返工。

本文结合官方文档、Artificial Analysis 独立测评和发布页实际截图,解释变化与限制。我们没有运行付费 API 对比测试,文中的跑分和案例都标明来源,不把厂商演示当作本站实测。

Claude Opus 5.5 参数与价格速览

项目已确认的信息
官方发布日期2026 年 9 月 22 日
Claude API 模型 IDclaude-opus-5-5
上下文窗口100 万 Token
标准最大输出12.8 万 Token
输入与输出类型输入文字、图片,输出文字
API 输入 / 输出单价每百万 Token 4 美元 / 20 美元
缓存读取每百万 Token 0.20 美元
默认推理档位medium;自适应思考始终开启
开发者接入Claude API、Amazon Bedrock、Claude Platform on AWS、Google Cloud、Microsoft Foundry

参数来自 Opus 5.5 官方模型文档,核验日期为 2026 年 9 月 23 日。Batch API 在指定 beta 配置下可输出最多 30 万 Token,不能与标准输出上限混为一谈。

订阅用户看到的是另一种变化:Anthropic 宣布提高 Pro、Max 和 Team 的五小时使用限额,并提供可以留到需要时再使用的额度重置。API 降价不等于订阅月费下降,也不能据此推算某个账户每天能发多少条消息。

便宜多少,要把三笔账分开看

“成本下降 40%”是这次发布最容易被转述错的一句话。

官方的意思是:在其测试的典型工作负载和默认设置下,完成任务的成本比 Opus 5 低约 40%。其中既有单价下降,也有完成任务所需 Token 减少的影响。它不是所有请求统一打六折。

计费项Opus 5.5Opus 5单价变化
普通输入$4$5降低 20%
输出$20$25降低 20%
缓存读取$0.20$0.50降低 60%
5 分钟缓存写入$5$6.25降低 20%

以上均为每百万 Token 的美元价格,来自官方公告及新版文档。Opus 5.5 的 1 小时缓存写入为 $8;Batch 普通输入和输出为 $2 / $10,适用于对应处理方式。

用一个简单例子算账:假设一次任务消耗 10 万普通输入 Token、100 万缓存读取 Token、2 万输出 Token,Opus 5.5 的费用是 $0.40 + $0.20 + $0.40 = $1.00。相同用量按 Opus 5 单价计算是 $0.50 + $0.50 + $0.50 = $1.50,节省约 33.3%。这个例子不含缓存写入、工具费用,也没有假设模型会少用 Token。

所以,反复读取同一批仓库文件的编程 Agent,可能比一次性问答更受益。真正要记录的是“完成一个合格任务花多少钱”,而不只是每百万 Token 的标价。

Fast mode 则是单独的取舍:官方给出的速度最高可达 2.5 倍,输入 / 输出为 $8 / $40。开发文档把它列为 Claude API 的研究预览功能,不能默认认为每个云平台都支持。

测评成绩不错,但不是每项都赢

官方发布表里,Opus 5.5 的编程成绩很突出:Terminal-Bench 4.0 为 66.4%,CursorBench 4.0 为 57.8%。这些测试更接近多步骤命令行操作和跨文件修改,比单独写一道小函数更能反映 Agent 的工作方式。

Anthropic 官方测评表,展示 Opus 5.5 与 Fable 5.1、Opus 5、GPT-6 Astra 等模型的成绩 来源:Anthropic 发布页,2026 年 9 月 23 日实际截图。属于官方汇总数据,测试条件见下文和原页脚注。

测试Opus 5.5Opus 5怎样理解
Terminal-Bench 4.066.4%52.3%命令行里的多步骤任务
CursorBench 4.057.8%46.6%需求不完全明确的跨文件编程任务
GDPval-AA v2.11846 Elo1708 Elo职业工作任务的相对评分,不是正确率
AutomationBench40.0%26.9%跨应用业务流程;该项由 Zapier 运行并提供结果
OSWorld 2.081.8%74.0%部分完成度指标,不是端到端成功率

这张表要连着脚注读。除特别说明外,Opus 5.5 使用最高推理档位;Terminal-Bench 用的是 xhigh,其标准误差为 ±2.6 个百分点。部分敏感任务触发安全机制后,由其他 Claude 型号继续处理。Zapier 的 AutomationBench 没有启用这种回退,安全拦截按失败计算。

也有明确的反例:同一张官方表中,GPT-6 Astra 在 AutomationBench 是 41.4%,高于 Opus 5.5 的 40.0%;在 Terminal-Bench-Science 是 64.6%,也高于 58.7%。因此,把这次更新写成“全面碾压”并不准确。

独立测评给了什么证据

Artificial Analysis 的 Opus 5.5 页面在我们核验时显示:Intelligence Index 约 58 分,该页面的排名为 1 / 661。配置名称完整写着 Adaptive Reasoning、Max Effort、Default Fallback,即自适应思考、最高推理档位、启用默认回退模型。

Artificial Analysis 的真实图表截图,Opus 5.5 在 Intelligence Index v4.3.2 中显示约 58 分 来源:Artificial Analysis,2026 年 9 月 23 日截图。榜单会更新;图中只展示当前筛选的部分模型配置。

这项指数的 v4.3.2 版本综合了 10 项评测。它提供了厂商之外的支持:Opus 5.5 的进步不只出现在 Anthropic 自己的表里。但它仍然是特定配置的综合分数,既不是 58% 正确率,也不能直接代表默认 medium 档位的表现。

我们还发现,发布初期该页面的速度和任务成本部分仍显示 N/A,价格摘要出现 $0.00。本文没有采用这些异常价格字段,费用以 Anthropic 文档为准。新模型刚发布时,榜单更新往往不是所有字段同时完成,这也是看原始页面比只转发一张排名图更有价值的原因。

编程与写作,最值得试的是少返工

对开发者来说,最有吸引力的场景是迁移、审查和跨模块修改:文件多、上下文杂,中间还要反复跑测试。官方列出的早期用户反馈主要围绕步骤减少、Token 减少和返工减少。不过,这些案例由厂商挑选展示,不能当成你的项目一定能复现的工时承诺。

一个容易试的任务,是拿最近做完的真实改动重新评估:固定仓库版本,给出同一份需求,让新旧模型分别执行。除了看测试通过率,也检查有没有顺手改掉业务行为、遗漏边界条件,或者把测试改得更容易通过。

回复是否好读,同样影响成本。你看不懂它为什么改,就得再问一轮;它把关键结论埋在长篇分析里,你就更容易漏掉问题。

Anthropic 官方发布页的回复对比界面:Opus 5 与 Opus 5.5 解释同一个计费错误 来源:官方 Communication 演示。这是发布页实际交互界面的截图,不是 Mengbi 登录 Claude 后运行的测试。

上面的例子中,Opus 5.5 先说清楚账单下降里哪部分来自计费错误,再解释日期边界为什么漏掉了月底用量。读者不用先读完几段代码,才知道问题到底影响了什么。

这能说明官方在改善表达顺序,不能证明它已经擅长所有中文写作。想判断中文是否适合你,最好给它一段自己真正会发布的内容:产品说明、客户邮件或技术文章。看它能不能把话说顺,有没有硬译的英文句式,会不会为了显得专业而凭空加结论。

API 升级前,先排查这几处

Opus 5.5 的模型名是 claude-opus-5-5,但现有 Opus 5 项目不能只替换这一个字符串。官方迁移说明列出了会影响请求和界面的变化:

  1. 不能关闭思考。 thinking.type: disabled 和旧式手动 budget_tokens 配置会返回 400。省略 thinking,或使用 adaptive,再通过 output_config.effort 调节投入。
  2. 不能强制指定工具调用。 tool_choiceanytool 类型不受支持。检查依赖它们的工作流;结构化结果可考虑严格工具参数或结构化输出,但仍要单独处理“是否调用工具”。
  3. 带思考块的对话历史不能随意改写。 思考块与模型及前文绑定。对 2026 年 8 月 31 日起创建的账户,修改前面的系统提示、工具或消息后再重放,可能触发 400。具体处理方式以文档为准。
  4. 旧电脑操作工具需要迁移。 Claude API 和 Google Cloud 不接受 computer_20251124,需要改用 computer_toolset_20260801。Amazon Bedrock 的兼容情况不同,不要混用平台说明。
  5. 工具调用之间的进度文字换了位置。 它们会进入 thinking 块,默认显示设置不返回其正文。如果你的应用只展示 text 块,用户可能以为 Agent 卡住了。

还有一项不一定报错,却会改变结果:默认推理档位从 Opus 5 的 high 改成了 medium。对比新旧模型时要明确设置;同名档位也不代表相同的 Token 消耗。

安全限制也会影响业务结果。直接 API 调用被拒绝时,可能返回 HTTP 200,但 stop_reasonrefusal。你的程序需要识别这个结束原因,按官方支持的方式处理回退,而不是把“请求成功”当作“任务完成”。

值不值得升级

已经用 Opus 5 跑复杂编程和资料分析的团队,值得优先安排一轮小范围对比。 更低的普通输入、输出和缓存读取价格都已确认;独立测评也给出了较强的能力信号。最需要你自己验证的是:现有工具链能否兼容,以及返工是否真的减少。

如果工作主要是短文本分类、固定格式提取或简单问答,先别急着把所有流量都换过去。一个更便宜的现有模型如果已经稳定通过验收,新旗舰未必能带来足够收益。

建议从三类任务开始:一项有完整测试的代码改动、一份需要逐条核对来源的分析、一段有明确语气要求的中文写作。记录合格率、耗时、费用和人工修改量。拿到这些结果后,再决定扩大使用范围,比只看榜单名次更踏实。

还在比较工具,可以从 Claude 工具介绍看起;想了解上一代高端型号的定位,参见 Claude Fable 5.1 解读。需要挑选开发工具,则可以继续阅读 AI 编程 Agent 对比

常见问题

Claude Opus 5.5 什么时候发布?

Anthropic 官方发布日期为 2026 年 9 月 22 日。本文于北京时间 9 月 23 日完成核验,两个日期并不矛盾。

Claude Opus 5.5 API 多少钱?

官方普通输入为每百万 Token 4 美元,输出为 20 美元,缓存读取为 0.20 美元。缓存写入、Batch、Fast mode 和工具调用按各自规则计费。

Opus 5.5 真的比 Opus 5 便宜 40% 吗?

40% 是 Anthropic 对典型工作负载、默认设置的测试结论。普通输入和输出单价实际下降 20%,缓存读取下降 60%。你的总费用还取决于用量、缓存命中和重试情况。

Opus 5.5 比 Fable 5.1 更强吗?

Anthropic 将它定位为多数工作中接近 Fable 5.1 的能力,并展示了多个更高的测试成绩。独立综合指数也给出较强表现,但这些结果不能保证每种任务都更好,尤其要留意推理档位和回退模型配置。

Opus 5.5 支持多长上下文,可以生成图片吗?

官方上下文窗口为 100 万 Token,标准最大输出为 12.8 万 Token。它可以接收文字和图片,输出文字,不是原生图片生成模型。

Sonnet 5.5 和 Haiku 5.5 也发布了吗?

在这份公告里,Anthropic 说它们将在接下来几周推出,没有给出具体日期。不能把 Opus 5.5 的发布当成整个 5.5 系列已经全部上线。

来源与核验范围

最后核验:2026 年 9 月 23 日。正文截图采自所标注的真实页面。排名、平台开放情况和文档可能继续更新,本文保留的是核验时的状态。

文中提到的 AI 工具

MENGBI

在做 AI 产品?欢迎聊聊。

想把产品收录到 Mengbi,或者通过一个 API 接入主流 AI 模型,享受更有竞争力的价格?欢迎联系我们。