Claude Opus 5.5 已经发布。 Anthropic 在 9 月 22 日的官方公告中,把重点放在三件日常工作真正用得上的事:复杂任务做得更好,调用成本更低,回复更容易看懂。
如果你每天让 Claude 改代码、读资料、写方案,这次更新值得认真看。最直观的变化是 API 输入和输出单价都降了 20%;更值得验证的,则是它能否少走弯路,让你少花时间盯着它返工。
本文结合官方文档、Artificial Analysis 独立测评和发布页实际截图,解释变化与限制。我们没有运行付费 API 对比测试,文中的跑分和案例都标明来源,不把厂商演示当作本站实测。
Claude Opus 5.5 参数与价格速览
| 项目 | 已确认的信息 |
|---|---|
| 官方发布日期 | 2026 年 9 月 22 日 |
| Claude API 模型 ID | claude-opus-5-5 |
| 上下文窗口 | 100 万 Token |
| 标准最大输出 | 12.8 万 Token |
| 输入与输出类型 | 输入文字、图片,输出文字 |
| API 输入 / 输出单价 | 每百万 Token 4 美元 / 20 美元 |
| 缓存读取 | 每百万 Token 0.20 美元 |
| 默认推理档位 | medium;自适应思考始终开启 |
| 开发者接入 | Claude API、Amazon Bedrock、Claude Platform on AWS、Google Cloud、Microsoft Foundry |
参数来自 Opus 5.5 官方模型文档,核验日期为 2026 年 9 月 23 日。Batch API 在指定 beta 配置下可输出最多 30 万 Token,不能与标准输出上限混为一谈。
订阅用户看到的是另一种变化:Anthropic 宣布提高 Pro、Max 和 Team 的五小时使用限额,并提供可以留到需要时再使用的额度重置。API 降价不等于订阅月费下降,也不能据此推算某个账户每天能发多少条消息。
便宜多少,要把三笔账分开看
“成本下降 40%”是这次发布最容易被转述错的一句话。
官方的意思是:在其测试的典型工作负载和默认设置下,完成任务的成本比 Opus 5 低约 40%。其中既有单价下降,也有完成任务所需 Token 减少的影响。它不是所有请求统一打六折。
| 计费项 | Opus 5.5 | Opus 5 | 单价变化 |
|---|---|---|---|
| 普通输入 | $4 | $5 | 降低 20% |
| 输出 | $20 | $25 | 降低 20% |
| 缓存读取 | $0.20 | $0.50 | 降低 60% |
| 5 分钟缓存写入 | $5 | $6.25 | 降低 20% |
以上均为每百万 Token 的美元价格,来自官方公告及新版文档。Opus 5.5 的 1 小时缓存写入为 $8;Batch 普通输入和输出为 $2 / $10,适用于对应处理方式。
用一个简单例子算账:假设一次任务消耗 10 万普通输入 Token、100 万缓存读取 Token、2 万输出 Token,Opus 5.5 的费用是 $0.40 + $0.20 + $0.40 = $1.00。相同用量按 Opus 5 单价计算是 $0.50 + $0.50 + $0.50 = $1.50,节省约 33.3%。这个例子不含缓存写入、工具费用,也没有假设模型会少用 Token。
所以,反复读取同一批仓库文件的编程 Agent,可能比一次性问答更受益。真正要记录的是“完成一个合格任务花多少钱”,而不只是每百万 Token 的标价。
Fast mode 则是单独的取舍:官方给出的速度最高可达 2.5 倍,输入 / 输出为 $8 / $40。开发文档把它列为 Claude API 的研究预览功能,不能默认认为每个云平台都支持。
测评成绩不错,但不是每项都赢
官方发布表里,Opus 5.5 的编程成绩很突出:Terminal-Bench 4.0 为 66.4%,CursorBench 4.0 为 57.8%。这些测试更接近多步骤命令行操作和跨文件修改,比单独写一道小函数更能反映 Agent 的工作方式。
来源:Anthropic 发布页,2026 年 9 月 23 日实际截图。属于官方汇总数据,测试条件见下文和原页脚注。
| 测试 | Opus 5.5 | Opus 5 | 怎样理解 |
|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 52.3% | 命令行里的多步骤任务 |
| CursorBench 4.0 | 57.8% | 46.6% | 需求不完全明确的跨文件编程任务 |
| GDPval-AA v2.1 | 1846 Elo | 1708 Elo | 职业工作任务的相对评分,不是正确率 |
| AutomationBench | 40.0% | 26.9% | 跨应用业务流程;该项由 Zapier 运行并提供结果 |
| OSWorld 2.0 | 81.8% | 74.0% | 部分完成度指标,不是端到端成功率 |
这张表要连着脚注读。除特别说明外,Opus 5.5 使用最高推理档位;Terminal-Bench 用的是 xhigh,其标准误差为 ±2.6 个百分点。部分敏感任务触发安全机制后,由其他 Claude 型号继续处理。Zapier 的 AutomationBench 没有启用这种回退,安全拦截按失败计算。
也有明确的反例:同一张官方表中,GPT-6 Astra 在 AutomationBench 是 41.4%,高于 Opus 5.5 的 40.0%;在 Terminal-Bench-Science 是 64.6%,也高于 58.7%。因此,把这次更新写成“全面碾压”并不准确。
独立测评给了什么证据
Artificial Analysis 的 Opus 5.5 页面在我们核验时显示:Intelligence Index 约 58 分,该页面的排名为 1 / 661。配置名称完整写着 Adaptive Reasoning、Max Effort、Default Fallback,即自适应思考、最高推理档位、启用默认回退模型。
来源:Artificial Analysis,2026 年 9 月 23 日截图。榜单会更新;图中只展示当前筛选的部分模型配置。
这项指数的 v4.3.2 版本综合了 10 项评测。它提供了厂商之外的支持:Opus 5.5 的进步不只出现在 Anthropic 自己的表里。但它仍然是特定配置的综合分数,既不是 58% 正确率,也不能直接代表默认 medium 档位的表现。
我们还发现,发布初期该页面的速度和任务成本部分仍显示 N/A,价格摘要出现 $0.00。本文没有采用这些异常价格字段,费用以 Anthropic 文档为准。新模型刚发布时,榜单更新往往不是所有字段同时完成,这也是看原始页面比只转发一张排名图更有价值的原因。
编程与写作,最值得试的是少返工
对开发者来说,最有吸引力的场景是迁移、审查和跨模块修改:文件多、上下文杂,中间还要反复跑测试。官方列出的早期用户反馈主要围绕步骤减少、Token 减少和返工减少。不过,这些案例由厂商挑选展示,不能当成你的项目一定能复现的工时承诺。
一个容易试的任务,是拿最近做完的真实改动重新评估:固定仓库版本,给出同一份需求,让新旧模型分别执行。除了看测试通过率,也检查有没有顺手改掉业务行为、遗漏边界条件,或者把测试改得更容易通过。
回复是否好读,同样影响成本。你看不懂它为什么改,就得再问一轮;它把关键结论埋在长篇分析里,你就更容易漏掉问题。
来源:官方 Communication 演示。这是发布页实际交互界面的截图,不是 Mengbi 登录 Claude 后运行的测试。
上面的例子中,Opus 5.5 先说清楚账单下降里哪部分来自计费错误,再解释日期边界为什么漏掉了月底用量。读者不用先读完几段代码,才知道问题到底影响了什么。
这能说明官方在改善表达顺序,不能证明它已经擅长所有中文写作。想判断中文是否适合你,最好给它一段自己真正会发布的内容:产品说明、客户邮件或技术文章。看它能不能把话说顺,有没有硬译的英文句式,会不会为了显得专业而凭空加结论。
API 升级前,先排查这几处
Opus 5.5 的模型名是 claude-opus-5-5,但现有 Opus 5 项目不能只替换这一个字符串。官方迁移说明列出了会影响请求和界面的变化:
- 不能关闭思考。
thinking.type: disabled和旧式手动budget_tokens配置会返回 400。省略thinking,或使用adaptive,再通过output_config.effort调节投入。 - 不能强制指定工具调用。
tool_choice的any和tool类型不受支持。检查依赖它们的工作流;结构化结果可考虑严格工具参数或结构化输出,但仍要单独处理“是否调用工具”。 - 带思考块的对话历史不能随意改写。 思考块与模型及前文绑定。对 2026 年 8 月 31 日起创建的账户,修改前面的系统提示、工具或消息后再重放,可能触发 400。具体处理方式以文档为准。
- 旧电脑操作工具需要迁移。 Claude API 和 Google Cloud 不接受
computer_20251124,需要改用computer_toolset_20260801。Amazon Bedrock 的兼容情况不同,不要混用平台说明。 - 工具调用之间的进度文字换了位置。 它们会进入
thinking块,默认显示设置不返回其正文。如果你的应用只展示text块,用户可能以为 Agent 卡住了。
还有一项不一定报错,却会改变结果:默认推理档位从 Opus 5 的 high 改成了 medium。对比新旧模型时要明确设置;同名档位也不代表相同的 Token 消耗。
安全限制也会影响业务结果。直接 API 调用被拒绝时,可能返回 HTTP 200,但 stop_reason 是 refusal。你的程序需要识别这个结束原因,按官方支持的方式处理回退,而不是把“请求成功”当作“任务完成”。
值不值得升级
已经用 Opus 5 跑复杂编程和资料分析的团队,值得优先安排一轮小范围对比。 更低的普通输入、输出和缓存读取价格都已确认;独立测评也给出了较强的能力信号。最需要你自己验证的是:现有工具链能否兼容,以及返工是否真的减少。
如果工作主要是短文本分类、固定格式提取或简单问答,先别急着把所有流量都换过去。一个更便宜的现有模型如果已经稳定通过验收,新旗舰未必能带来足够收益。
建议从三类任务开始:一项有完整测试的代码改动、一份需要逐条核对来源的分析、一段有明确语气要求的中文写作。记录合格率、耗时、费用和人工修改量。拿到这些结果后,再决定扩大使用范围,比只看榜单名次更踏实。
还在比较工具,可以从 Claude 工具介绍看起;想了解上一代高端型号的定位,参见 Claude Fable 5.1 解读。需要挑选开发工具,则可以继续阅读 AI 编程 Agent 对比。
常见问题
Claude Opus 5.5 什么时候发布?
Anthropic 官方发布日期为 2026 年 9 月 22 日。本文于北京时间 9 月 23 日完成核验,两个日期并不矛盾。
Claude Opus 5.5 API 多少钱?
官方普通输入为每百万 Token 4 美元,输出为 20 美元,缓存读取为 0.20 美元。缓存写入、Batch、Fast mode 和工具调用按各自规则计费。
Opus 5.5 真的比 Opus 5 便宜 40% 吗?
40% 是 Anthropic 对典型工作负载、默认设置的测试结论。普通输入和输出单价实际下降 20%,缓存读取下降 60%。你的总费用还取决于用量、缓存命中和重试情况。
Opus 5.5 比 Fable 5.1 更强吗?
Anthropic 将它定位为多数工作中接近 Fable 5.1 的能力,并展示了多个更高的测试成绩。独立综合指数也给出较强表现,但这些结果不能保证每种任务都更好,尤其要留意推理档位和回退模型配置。
Opus 5.5 支持多长上下文,可以生成图片吗?
官方上下文窗口为 100 万 Token,标准最大输出为 12.8 万 Token。它可以接收文字和图片,输出文字,不是原生图片生成模型。
Sonnet 5.5 和 Haiku 5.5 也发布了吗?
在这份公告里,Anthropic 说它们将在接下来几周推出,没有给出具体日期。不能把 Opus 5.5 的发布当成整个 5.5 系列已经全部上线。
来源与核验范围
- Anthropic 官方发布公告:发布日期、产品变化、厂商测试及早期用户反馈。
- Opus 5.5 模型文档:参数、价格、输入输出与可用平台。
- Opus 5.5 新版与兼容性说明:请求变更、思考机制、工具和回退处理。
- Artificial Analysis 原始测评页面:独立指数和测试配置。
- Artificial Analysis 指数说明:综合指数的构成与解释。
最后核验:2026 年 9 月 23 日。正文截图采自所标注的真实页面。排名、平台开放情况和文档可能继续更新,本文保留的是核验时的状态。

