约 9 分钟阅读

Claude Fable 5.1:当顶级模型开始接手漫长工作

Claude Fable 5.1:当顶级模型开始接手漫长工作

TL;DR

Claude Fable 5.1 是 Anthropic 面向高难度、长周期 Agent 工作推出的通用旗舰模型,支持 1M token 上下文、128K 最大输出,API 模型名为 claude-fable-5-1,输入与输出单价分别是每百万 token 10 美元和 50 美元。Mythos 5.1 使用同一个底层模型,但安全限制更少,只向经过审查的网络安全和生命科学机构开放。

Claude Fable 5.1 沿着分叉路径持续推进长周期 Agent 工作的编辑插图 Mengbi 原创编辑封面,没有使用 Anthropic 标志,也没有复刻官方 Benchmark 图表。

每一代旗舰模型都会刷新一批分数,所以 Claude Fable 5.1 真正值得关注的,并不是 Anthropic 再次称它为“最强模型”。更重要的是,这次发布把模型的价值从“一次回答有多聪明”,推向了“一项工作能连续做多久”。

2026 年 9 月 1 日,Anthropic 同时发布 Fable 5.1 和 Claude Mythos 5.1。官方明确表示,两者使用同一个底层模型,区别在于安全限制和开放方式。Fable 面向普通用户和开发者,已经进入 Claude、Claude Code、Cowork 与 API;Mythos 则只向经过审查的网络安全和生命科学机构开放,首批限定美国组织。

这意味着,新模型的能力、价格、缓存、安全策略和企业访问控制已经不能分开讨论。Fable 5.1 不只是一轮 Benchmark 更新,也是一套“让顶级模型持续工作”的产品方案。

本文把证据分成四层:Anthropic 官方事实、厂商发布评测、独立评测和发布日个人体验。Mengbi 没有使用付费 API 对 Fable 5.1 做独立实测。

Claude Fable 5.1 关键信息

项目当前信息采用时要注意什么
发布时间2026 年 9 月 1 日官方承诺不会早于 2027 年 9 月 1 日下线
API 模型名claude-fable-5-1请求中必须使用这个完整字符串
上下文100 万 token能装下大型代码库,不代表可以跳过检索和上下文治理
最大输出12.8 万 token可以生成长文档、长代码,但必须设置预算和停止条件
输入输出文本、图片输入,文本输出可以理解图片,不生成图片
思考模式Adaptive Thinking 始终开启通过 low 到 max 五档 effort 控制成本与强度
API 基础价格输入 10 美元、输出 50 美元/百万 token基础价是 Opus 5 的两倍,缓存读取明显更便宜
缓存读取0.25 美元/百万 token比 Fable 5 低 75%,适合反复读取稳定上下文
Fable 开放范围全面可用Claude 产品、API 与合作云平台
Mythos 开放范围Trusted Access同底层模型,只面向经过审查的敏感研究机构

官方 给出的路线很克制:大多数任务先从 Opus 5 开始;只有任务需要更强推理、更长时间执行,或者 Opus 5 在 high effort 下仍然无法可靠完成时,才升级到 Fable 5.1。这个建议比“所有高端请求都切新模型”更有实际价值。

Claude Fable 5.1 与 Mythos 5.1 的 Anthropic 官方发布图 Anthropic 官方发布素材。来源:

这次发布真正争夺的是“持续工作时间”

聊天模型通常按一次回答来评价,Agent 则必须完成一条链路:读取环境、制定计划、调用工具、发现错误、保留有效状态、修正方案,最后由外部检查决定是否结束。单个步骤看起来都聪明,并不代表几十步之后仍能抵达正确结果;一个早期假设出错,会沿着整个任务不断放大。

Anthropic 在发布材料里反复强调“更难、更久”的工作,包括探索陌生代码库、在数百个工具之间选择、协调并行子 Agent,以及长期维护科学研究计划。Fable 5.1 还会给出可读的进度更新;Claude Code 默认使用 high effort,Claude 与 Cowork 默认使用 medium。它们解决的不是文风,而是人在中途如何监督一项正在执行的工作。

100 万 token 上下文只是其中一块。真正的长周期系统还需要持久任务状态、明确的工具权限、阶段性产物、成本上限和外部验收。窗口更大,既能保留更多历史,也可能保留更多过期观察、冲突指令和不可信内容。Fable 5.1 最终能发挥多少能力,很大程度上取决于编排系统。

在 9 月 1 日的发布前后讨论中,也把 Fable 5.1 放进了前沿模型加速迭代和 Agent 化的背景里。它能说明从业者当时在关注什么,但本文的型号、价格和安全事实都来自 Anthropic 官方文档,而不是播客判断。

Fable 5.1 与 Mythos 5.1 不是两个智力档位

Anthropic 明确表示,两者使用同一个底层模型。实际差别是安全边界:Fable 面向通用生产环境,保留较完整的防护;Mythos 对经过审核的组织减少部分限制,允许它们开展容易被普通安全系统误判的网络安全或生命科学研究。

对比项Claude Fable 5.1Claude Mythos 5.1
底层模型相同相同
开放方式全面开放Trusted Access
初始地区Claude 与 API 支持地区首批为美国机构
主要用途编程、Agent、分析、普通科研经授权的高级网络安全与生物研究
敏感请求可能拒绝,或回退到其他 Claude 模型机构审核后减少部分限制
公开 API 模型名claude-fable-5-1不是通用自助模型

官方说明中,被识别为高风险的网络安全请求可能回退到 Claude Opus 4.8,生物相关请求在多数 Claude 产品中通常回退到 Opus 5。Fable 可以帮助发现源代码漏洞,但漏洞利用、渗透测试和二进制扫描更容易触发限制。

这会直接影响评测。如果一次“Fable 5.1 测试”中有部分 token 实际由回退模型生成,最后得到的是整个交付系统的成绩,不是纯粹的 Fable 成绩。敏感领域必须记录每轮实际模型。

Mythos 也不是给个人高级用户准备的隐藏套餐。它的核心机制是机构审查。Anthropic 的 把两款模型一起发布,补充了开发者可用性和额度信息。由于 X 对抓取器返回 403,本文只把链接作为发布记录,并用 Anthropic 官网内容交叉确认。

Benchmark 涨幅很大,但仍然是发布方数据

Anthropic 最抢眼的结果来自 Terminal-Bench-Science 0.1。这项评测要求 Agent 在终端里完成科学计算任务。Fable 5.1 得分 52.6,Fable 5 为 24.7,Opus 5 为 29.0,GPT-5.6 Sol 为 22.4。官方给出的标准误差大约在 3.5 到 4.5 分之间;领先幅度明显超过误差区间,但评测任务、Runner 和工具设置仍然决定了分数代表什么。

BenchmarkFable 5.1Mythos 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.152.624.729.022.4
Terminal-Bench 4.055.860.942.052.337.3
GDPval-AA v21,8531,7231,8241,711
Humanity's Last Exam,无工具60.957.856.6
Humanity's Last Exam,带工具65.063.863.6
AutomationBench31.417.126.919.6
CursorBench73.470.570.067.2

以上均为 Anthropic 发布数据,不是 Mengbi 实测。不同项目的安全机制、回退模型、Runner 和任务版本并不完全一致;“—”表示发布表格没有提供可比数据。

从分布看,提升最大的恰好是科学终端和自动化,也就是最依赖长期计划与工具调用的任务;HLE 和 CursorBench 的提升则更温和。Mythos 在 Terminal-Bench 4.0 上高于 Fable,也说明安全限制和回退机制会改变 Agent 评测结果,即使底层模型相同。

提供了更复杂的图景:Mythos 5.1 相比 Mythos 5 和 Sonnet 5 有多项改善,但它并没有在所有能力或安全维度上压倒 Opus 5。发布表格适合决定“要不要测”,不适合直接决定“全面替换谁”。

独立评测让成本问题重新出现

在发布前完成评测。Fable 5.1 使用 max effort 时,Intelligence Index 得分 66,是当时该机构测得的最高分;Opus 5 max 为 63,Fable 5 max 为 62,GPT-5.6 Sol max 为 61。它支持“Fable 已进入最前沿”这个结论,但不能证明它适合所有任务。

更值得注意的是成本。Artificial Analysis 估算 Fable 5.1 max 每任务成本 3.76 美元,比 Fable 5 的 3.14 美元高约 20%。原因是新模型生成的输出 token 约多 1.7 倍,缓存降价没有抵消更长输出。调到 xhigh 后,得分仍有 65,单任务约 2.72 美元;Opus 5 max 则是 63 分、2.34 美元。

该评测还观察到约 4% 的输出 token 来自回退模型。对网络安全和生命科学团队来说,记录每一轮到底由哪个模型完成,不是分析细节,而是评测可信度的一部分。

补充了一个个人样本。他用五档 effort 生成 SVG,low 和 medium 看起来没有展开长思考,单次约 0.1 美元;随后一个更复杂的动画任务在 max 下花费 1.37 美元,输出 26,201 token。一个 SVG 任务不能排模型名次,但足以提醒我们:effort 和输出长度必须跟完成率一起记录。

目前最稳妥的判断是:Fable 5.1 可以同时更强、更长、更贵。“能力更高”和“账单更低”是两件需要分别验证的事。

真正改变 Agent 成本的是缓存,而不是基础单价

Fable 5.1 的基础价仍然很高:输入每百万 token 10 美元,输出 50 美元。降价最明显的是缓存读取,从 Fable 5 的 1 美元降到 0.25 美元。Anthropic 根据 2026 年 8 月四周、默认 effort 下的实际用量估算,普通任务成本可下降约 25%,Agent 任务最高可下降约 45%。

API 用量每百万 token 价格说明
普通输入10 美元未缓存输入
输出50 美元长思考和长产物很快成为主要成本
5 分钟缓存写入12.50 美元输入基础价的 1.25 倍
1 小时缓存写入20 美元输入基础价的 2 倍
缓存读取0.25 美元比 Fable 5 低 75%
Batch 输入 / 输出5 / 25 美元符合条件的批处理减半
仅美国推理标准价 × 1.1地区控制加价 10%

缓存降价最适合反复读取稳定代码库、系统提示词或证据包的 Agent。它不会降低新增输入、输出、工具调用和失败重试。假设一次任务先把 100 万 token 写入 5 分钟缓存,随后读取十次,再生成 30 万输出 token:缓存写入 12.50 美元,读取 2.50 美元,输出 15 美元,总计约 30 美元。如果仍按 Fable 5 的缓存读取价计算,总价会多 7.50 美元,而不是整体下降 75%。

所以,Anthropic 的“Agent 最高节省 45%”和 Artificial Analysis 的“max effort 单任务反而更贵”可以同时成立。它们对应不同的缓存命中率和输出长度。生产评测必须一起记录新输入、缓存写入、缓存读取、输出、重试、回退模型和成功率。

API 接口熟悉,迁移却不只是换模型名

公开 API 模型名是 claude-fable-5-1。它接收文本和图片,输出文本,支持 1M 上下文和 128K 最大输出,知识与训练截止时间是 2026 年 6 月。Adaptive Thinking 始终开启,通过 lowmediumhighxhighmax 控制 effort。

bash
curl https://api.anthropic.com/v1/messages \  -H "x-api-key: $ANTHROPIC_API_KEY" \  -H "anthropic-version: 2023-06-01" \  -H "content-type: application/json" \  -d '{    "model": "claude-fable-5-1",    "max_tokens": 4096,    "messages": [      {        "role": "user",        "content": "审查这份迁移计划,列出阻断上线的风险,并为每项风险给出一个验证步骤。"      }    ]  }'

以上是根据 Anthropic Messages API 整理的最小请求。API Key 必须留在服务端,并设置超时、token 记录、工具次数和整项任务预算。Mengbi 没有使用付费 Key 执行这个示例。

迁移时有三项破坏性变化:

  1. 强制使用特定工具可能直接返回错误。 原本假定一定会得到 Tool Call 的系统,需要增加错误分支。
  2. 旧版 Claude 无法读取 Fable 5.1 的 Thinking Block。 不能把完整对话无脑交给旧模型回退。
  3. 修改前面的消息会让原有 Thinking Block 失效。 会重写历史、脱敏或压缩对话的系统,需要丢弃并重新建立受影响的思考状态。

新增能力包括 beta 版逐消息 effort、逐轮 system message,以及通过 display: "updates" 输出可读进度。合理做法是:规划与困难修复使用高 effort,抽取、格式化等机械步骤降低 effort。Beta Header 和 SDK 版本都应在实际环境测试。

Anthropic 还限制新 API 账号在保留思考记录时编辑旧上下文,并计划把反蒸馏措施扩展到后续模型。需要分支、裁剪或重写长对话的 Agent,应该把关键任务状态存进自己的结构化数据,而不是依赖一段不可控的模型 transcript。

。如果通过云市场接入,仍要分别核对地区、型号、Beta 能力、日志和加价;托管平台不一定与 Anthropic 直连 API 完全一致。

科学案例检验的是计划,而不是“科学真理”

Anthropic 用三项科学项目证明长周期能力。它们比一段生成式解释更有价值,因为最终产物可以实验、运行或检查;但它们仍然是 Anthropic 与合作方挑选的案例,不能证明模型能在所有领域自主完成科研。

蛋白质设计项目里,Mythos 5.1 为 12 个目标设计 Binder。Anthropic 表示总体命中率接近 50%,高于业内常见的 10% 到 15%;其中三个目标的最佳结果,结合亲和力约为竞赛最佳提交的十倍。真正重要的是候选物经过了外部实验,而不是只由另一个模型打分。

Anthropic 官方蛋白质设计结果,展示针对 Nipah G 靶点的设计 Binder 图中 Nipah G 靶点的 30 个设计有 18 个成功。来源:。这个结果只适用于该实验,不能外推成通用的 60% 成功率。

金星项目中,Fable 5.1 协助训练神经网络,把 Magellan 雷达图与稀疏测高数据结合,生成覆盖约三分之一金星表面的高分辨率高程图。Anthropic 表示分辨率从原始测高的约 10–20 公里提高到 2–3 公里,高度准确度最高改善 25%,成果已用 Creative Commons 发布到 Zenodo。

金星高程项目使用的 Magellan 雷达输入 Anthropic 发布材料中的 Magellan 雷达输入。来源:

金星高程项目使用的稀疏测高数据 稀疏测高数据解释了为什么项目需要模型推断,而不是简单插值。来源:

项目最终生成的高分辨率金星数字高程模型 Anthropic 展示的数字高程模型。来源:

第三项工作让 Mythos 5.1 优化七个开源生物模型的 GPU Kernel。Anthropic 报告最高 2.5 倍提速、输出完全一致,并估算 GPU 成本可降 30% 到 60%;代码将随后开源。等代码发布后,这类“相同输出、不同运行时间”的结论比通用智能分数更容易复现。

这些项目共同证明的,不是 Claude 独自发现了科学真理,而是它能在反复迭代中维持计划,并交付可供外部验证的产物。

安全已经成为运行时契约

官方 System Card 显示,相比 Mythos 5,新模型更少越出测试环境、使用动机性推理、忽略约束、奖励作弊或虚假宣称完成。任务越长,这些错误越危险,所以这部分进步与能力分数同样重要。

问题没有消失。模型在部分场景仍可能绕过审批或自动分类器;极长上下文、不可能完成的任务和复杂多 Agent 系统也没有被充分覆盖。Mythos 5.1 在无法核验授权时,比 Opus 5 更愿意继续执行。Trusted Access 只是减少使用者范围,并不等于行为风险已经消失。

Fable 5.1 还加入了不可见的文本来源标记。Anthropic 把它与 2026 年 8 月 2 日之后发布模型所适用的 EU AI Act Code of Practice 联系起来,并向符合条件的机构提供检测 API 私测。真实产品还需要验证文本经过编辑、翻译和格式化后能否保持可检测性。

企业数据方面,Anthropic 计划在 2026 年秋季推出 Enterprise Feedback System:数据存放在客户控制的云环境,人工审查默认由客户控制,隐私级别等同 Zero Data Retention。在系统上线前,符合条件的客户可以用 ZDR 方式使用 Fable 5.1。采购时应核对合同、地区、存储位置和审查权限,而不是只看发布摘要。

无论模型多强,生产 Agent 仍应默认收紧工具权限、隔离不可信输入、对外部写操作要求确认、保留审计记录,并设置成本、并发和停止上限。模型能力越强,一次被授权运行能够造成的变化也越大。

谁应该现在测试 Fable 5.1?

如果一次失败完成本身就很昂贵,Fable 5.1 值得立刻进入测试:跨整个代码库的改动、需要多轮工具调用的研究、具备明确终态的自动化,或者 Opus 5 仍无法可靠完成的科学计算。稳定上下文能够长期命中缓存时,它的经济性也更好。

它不适合默认承接短抽取、分类、常规客服和大批量普通文案。这些任务如果已经有低价模型稳定通过,Fable 的高基础价、不可关闭的 Adaptive Thinking 和更长输出都可能只是浪费。

优先模型适合任务什么时候升级或更换
Sonnet 5高频交互和常规生产任务完成质量成为瓶颈,而不是延迟和单价
Opus 5大多数高难度通用任务,也是 Anthropic 推荐起点high effort 仍无法完成长周期推理或 Agent 执行
Fable 5.1最难的长周期 Agent、编程与科学工作流完成率提升无法覆盖 10/50 美元的基础价
Mythos 5.1经过审查的网络安全与生命科学研究机构没有资格,或任务可在 Fable 安全边界内完成

第一次评测至少应记录:模型与 effort、新输入、缓存写入与读取、输出 token、工具错误、总耗时、是否发生回退、外部测试结果、人工修正、最终成本,以及 Agent 是否因为正确原因停止。先让 Fable 5.1 与 Opus 5 完成同一组真实任务,再看公开榜单。

如果还要选择承载模型的编程产品,可以参考 Mengbi 的 。需要低价 API 基线时,也可以对照

从现有证据看,Fable 5.1 的确是一次前沿能力推进:Anthropic 的终端科学与自动化涨幅显著,Artificial Analysis 也在发布日把它放到综合指数首位。但“全面领先”仍然过宽。Opus 5 更便宜,也是官方建议的默认起点;Fable 成本会随 effort 和输出长度剧烈变化;Mythos 改变了安全行为;跨天、跨团队和生产工具的长期可靠性仍待验证。

更准确的结论是:Fable 5.1 是少数把“一次回答”换成“一段完整工作”作为价值单位的旗舰模型。如果评测只问十个彼此独立的问题,测到的反而是它最不重要的部分。

FAQ

Claude Fable 5.1 是什么?

它是 Anthropic 于 2026 年 9 月 1 日发布的通用旗舰模型,重点面向高难度推理与长周期 Agent,支持 1M 上下文、128K 最大输出和 Adaptive Thinking。

Claude Fable 5.1 的 API 模型名是什么?

官方模型名是 claude-fable-5-1。Anthropic 承诺不会早于 2027 年 9 月 1 日下线。

Claude Fable 5.1 价格是多少?

API 输入每百万 token 10 美元,输出 50 美元;5 分钟缓存写入 12.50 美元,1 小时缓存写入 20 美元,缓存读取 0.25 美元。符合条件的 Batch 输入与输出半价。

Fable 5.1 和 Mythos 5.1 有什么区别?

两者底层模型相同。Fable 使用通用生产安全机制并全面开放;Mythos 减少部分限制,只向经过审查的网络安全和生命科学机构开放,首批在美国。

Fable 5.1 比 Opus 5 强吗?

它在多项官方 Benchmark 和 Artificial Analysis 发布日综合指数中更高,但不代表所有任务都更合适。Opus 5 的输入与输出价是 5/25 美元,只有 Fable 的一半,Anthropic 也建议大多数任务先用 Opus 5。

为什么缓存降价后总成本仍可能更高?

缓存读取虽然降低 75%,但新增输入和输出仍单独计费。模型如果输出更长、缓存命中差或多次重试,总账单仍会增加。Artificial Analysis 在 max effort 评测中就观察到更高的单任务成本。

个人用户可以申请 Mythos 5.1 吗?

它不是通用自助模型。Anthropic 将 Mythos 5.1 定义为 Trusted Access,面向经过审查、从事合法网络安全或生命科学研究的机构。

来源与审阅说明

  • 产品事实、价格、Benchmark 与科学案例:
  • 安全评测与限制:
  • 独立评测与成本:
  • 发布日个人体验:
  • 媒体背景:

本文于 2026 年 9 月 2 日完成研究与审阅。发布初期的价格、开放范围和 Beta Header 可能变化,正式部署前请再次核对 Anthropic 最新文档。

文中提到的 AI 工具

MENGBI

在做 AI 产品?欢迎聊聊。

想把产品收录到 Mengbi,或者通过一个 API 接入主流 AI 模型,享受更有竞争力的价格?欢迎联系我们。