[go: up one dir, main page]

跳至内容

Claude Fable 5.1:功能、基准测试与定价

Fable 5.1 维持 Fable 5 的标价,但将缓存读取削减 75%,且在 Anthropic 发布的全部基准上领先 Claude Opus 5。
更新 2026年9月2日  · 14分钟 读

用 AI 探索

ChatGPTClaudePerplexity

OpenAI 的 GPT-5.6 Sol 发布后,有评论称其已与 Anthropic 并驾齐驱。评估机构 Vals AI 告诉纽约时报,Sol 在标准基准测试上大致与 Claude Fable 5 相当。Anthropic 在 2026 年 9 月给出的回应是 Claude Fable 5.1,其称之为全球最先进的编程与知识工作模型,并有受限的孪生版本 Claude Mythos 5.1。

Fable 5.1 维持 Fable 5 的标价:每百万输入 Token $10、每百万输出 Token $50,同时将缓存读取费用下调 75% 至每百万 $0.25。Anthropic 估算,按 Token 计费的典型工作负载可实际节省约 25%,而高度具身(agentic)的任务最高可节省约 45%。该模型提供 100 万 Token 的上下文窗口与 128K 最大输出,并在 Terminal-Bench-Science 0.1 上将 Fable 5 的分数提升一倍多。

本文将全面介绍 Claude Fable 5.1 的更新内容,涵盖新特性、基准测试结果,以及实际运行成本。您也可以查看我们的 Claude Fable 5 指南以及 Claude Opus 5 与 Claude Fable 5 对比。

要点速览

  • Claude Fable 5.1 是 Anthropic 面向长周期编程与研究任务的普适前沿模型。
  • 标价与 Fable 5 相同,节省完全来自大幅更便宜的缓存上下文。
  • 它在 Anthropic 发布的全部基准上领先 Claude Opus 5,扭转了此前 Opus 5 取胜的项目。
  • 无人值守的代理运行优先选它;日常对话与撰写仍用 Sonnet 5 或 Opus 5。
  • Claude Mythos 5.1 是相同模型,但网络安全与生物学防护更宽松,仅限受邀使用。

什么是 Claude Fable 5.1?

Claude Fable 5.1 是 Anthropic 面向高强度推理与长周期具身任务的普适前沿模型。其定价位于 Claude 家族的最高端,高于每百万 Token $5 / $25 的 Claude Opus 5 和每百万 Token $2 / $10 的 Claude Sonnet 5;Anthropic 文档也将其延迟评为慢于二者。

更高价格带来的是在 Fable 5 标价下的能力,以及成本降为原来四分之一的缓存读取。思考为自适应且始终开启,可通过力度设置引导,Claude API 默认 high。知识截止于 2026 年 6 月。

头号结果来自具身科研基准 Terminal-Bench-Science 0.1:Fable 5.1 得分 52.6%,而 Fable 5 为 24.7%。Anthropic 同时给出一家投资公司 Millennium 的案例:其高级投资组合经理描述了一个约百万分之一概率的崩溃事件,团队 4 到 5 年无人能解释。Fable 5.1 反汇编了第三方厂商库,与核心转储匹配,最终将崩溃追溯到该库中的一个缺陷。

什么是 Claude Mythos 5.1?

Claude Mythos 5.1 与 Fable 5.1 是同一模型,但防护更宽松,仅通过 Anthropic 的可信访问项目开放。它不是更大的模型或不同的架构,且 Anthropic 未公布单独定价。唯一差异在于防护允许其执行的范围。

当前访问对象为一批美国机构,计划将逐步扩展。两个项目进行把关,均与美国政府合作开展:

  • 网络验证计划(Cyber Verification Program)涵盖防御性安全工作。
  • 生命科学验证计划(Life Sciences Verification Program)涵盖生命科学领域的专业研发。

两者差异在编程上尤为明显:Mythos 5.1 在 Terminal-Bench 4.0 上得分 60.9%,而 Fable 5.1 为 55.8%。Decrypt 将差异归因于 Fable 的额外防护,会将部分高风险任务路由给 Claude Opus 4.8,我们已在 Claude Fable 5 教程中描述。Anthropic 面向代码库扫描与建议补丁(供人工复核)的产品 Claude Security 现运行在 Mythos 5.1 上,我们的 Claude Mythos 5 指南回顾了上一代分叉的运作方式。

Claude Fable 5.1 关键特性

Fable 5.1 的五项改动改变了您使用 Claude 模型的实际方式,其中一项是定价决策而非能力变化。

让编码代理通宵运行

您可以将一项耗时数小时的任务交给 Fable 5.1,回来时获得完成的结果,而不是陷入卡顿循环。Anthropic 的早期合作伙伴对此给出了不同寻常的具体描述:

  • MongoDB 的 Ron Sanzone 描述了一个约 3 天内构建的原型:模型先研究其服务代码与文档,产出设计,然后无人值守地运行数小时并带有校验循环。
  • Ramp 的 Dwight Temple 报告了一次无人值守的 38 小时机器学习任务:诊断出早期结果是标签伪影并修正,夜间启动 6 个并行实验,最终返回结果与后续步骤。
  • Shopify 的 Ben Lafferty 直言:模型会自行记录、随着变化重新排序优先级,并从中断处继续。

100 万 Token 上下文窗口与 128K 最大输出使得如此长时间的运行成为可能,而 Jane Street 的 Craig Falls 指出,Fable 5.1 在长篇多步骤任务中仍保持可读性,而早期模型会变得难以跟进。

Anthropic 以 Mythos 5.1(相同权重但更宽松的防护)来衡量该模型在具身场景下的安全性,并报告称它是在外部提示注入基准上最难被攻破的已发布模型。其自动化行为审计发现,与 Mythos 5 相比,Mythos 5.1 的奖励投机(reward hacking)尝试与成功次数更少,且在遇到不可能完成的任务时更不倾向于越界使用测试环境外的资源。

Anthropic 也点明了差距:审计对超长上下文与多代理场景的可见性较低,而这恰好是 38 小时运行所处的领域。

用缓存上下文把 Fable 级代理的成本压下来

缓存读取现为每百万 Token $0.25,下降 75%,这改写了任何在每轮重读相同上下文的代理循环的成本计算。Anthropic 估算,按 Token 计费的典型工作负载成本约降低 25%,复杂编程与高度具身任务可达约 45%。如果您对提示缓存不熟悉,我们的 提示缓存指南介绍了具体机制。

查找软件漏洞而不被频繁拒绝

Fable 5.1 现可用于发现软件漏洞,但不能据此开发利用程序。Anthropic 称其最新的网络安全防护可减少约 60% 的误报拦截,Claude Code 用户平均每个会话的干预次数也将下降约 60%。

限制仍然存在。渗透测试、利用生成、基于二进制的漏洞扫描仍会被重定向到 Anthropic 的 Opus 模型,生命科学领域的研发同样如此。在生物学方面,Fable 5.1 与 Fable 5 的防护对良性的初级生物与医学问题的触发频率现在降低了 85%,这针对的是误报问题,而非能力限制。

交给它一个研究问题,让它深入挖掘

Fable 5.1 训练了一个神经网络,基于美国宇航局麦哲伦号(Magellan)30 多年前获取的雷达图像,生成了一份覆盖金星三分之一区域的高分辨率地形图。该图将分辨率从 10–20 公里提升到 2–3 公里,海拔高度精度也较此前提升最高达 25%。Anthropic 将其以知识共享许可发布在 Zenodo 上,先于 NASA 的 VERITAS 和欧洲航天局的 EnVision 任务。

生命科学方面的成果由 Mythos 5.1 完成——如果您快速阅读公告,这一点值得注意。它在 3 个靶标上设计出的蛋白结合物亲和力比 Adaptyv Bio 蛋白设计竞赛中最佳方案高 10 倍,并在 12 个靶标上实现了接近 50% 的有效结合率,而当前通常为 10%–15%。它还编写了自定义 GPU 内核,使 7 个开源深度学习模型在输出一致的情况下加速最高达 2.5 倍,将全基因组分析的预估 GPU 成本降低 30%–60%。

如果您在实验室工作,接入路径与能力同等重要。Anthropic 的“AI for Science”项目为高影响力研究提供免费额度,并为科研人员提供大幅折扣的 Claude Team 计划。公司还预览了“模型—硬件标准”,允许 Claude 直接操控实验设备。

将企业数据留在自有云上

企业前沿防护(Enterprise Frontier Safeguards,EFS)把客户数据存储在客户自有的云基础设施上,而非 Anthropic,从而在允许滥用检测的同时提供类似“零数据保留”的隐私保障。人工复核默认由客户执行。Anthropic 与 100 多家客户以及其云合作伙伴(AWS、Google Cloud、Microsoft Azure)共同打造了 EFS。

该能力将从今秋起分阶段上线,覆盖 Claude Code、Claude Enterprise、Claude Platform、Amazon Bedrock、Google 的 Agent Platform、以及 Microsoft Foundry。上线前,符合条件的客户可在零数据保留模式下运行 Fable 5.1。

Claude Fable 5.1 的基准表现如何?

Fable 5.1 在 Anthropic 发布的所有基准上都超过了 Claude Opus 5。VentureBeat 指出,这扭转了此前 Opus 5 领先的个别项目。相较 Fable 5 的提升在具身科研与终端编程上最大,在学术推理上最小。

基准 Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 52.6% 24.7% 29.0% 22.4%
Terminal-Bench 4.0 55.8% 42.0% 52.3% 37.3%
CursorBench 3.2.0 73.4% 70.5% 70.0% 67.2%
GDPval-AA v2(Elo) 1853 1723 1824 1711
AutomationBench 31.4% 17.1% 26.9% 19.6%
Humanity's Last Exam(含工具) 65.0% 63.8% 63.6% 未发布
OSWorld 2.0(严格) 41.7% 36.1% 39.6% 未发布

以上数据均为 Anthropic 自测,且在开启 Fable 5.1 的生产防护下测得。

具身科研与终端编程

这一代际差距最为明显。在 Terminal-Bench-Science 0.1 上(评估在终端中进行的具身科研),Fable 5.1 得分 52.6%,而 Fable 5 为 24.7%、Opus 5 为 29.0%、GPT-5.6 Sol 为 22.4%。

Fable 5.1 在具身科学任务上将 Fable 5 的成绩翻倍有余

更应关注差距而非小数点。Anthropic 报告该基准每个模型的标准误差为 ±3.5 到 4.5 分,并指出公共榜单将 Opus 5 记为 30.0%、Fable 5 记为 21.4%,二者在其自有环境中复现落在噪声范围内。

在测试多步命令行编码与调试的 Terminal-Bench 4.0 上,Fable 5.1 得分 55.8%,对比 Fable 5 的 42.0% 与 Opus 5 的 52.3%。在评估 IDE 内工作流编码的 CursorBench 3.2.0 上,其成绩为 73.4%,领先 Fable 5 的 70.5% 与 Opus 5 的 70.0% 几分。

知识工作与业务流程

知识工作也有提升,但排序不同。GDPval-AA v2(类似 Elo 的知识工作质量度量)上,Fable 5.1 得分 1853,对比 Opus 5 的 1824 与 Fable 5 的 1723。相对 Opus 5 是小步前进,相对 Fable 5 则进步明显。

覆盖业务流程自动化的 AutomationBench 将它们拉开更大差距:Fable 5.1 为 31.4%、Opus 5 为 26.9%、Fable 5 为 17.1%。Anthropic 指出,Fable 5 在生产防护介入的任务上计为 0 分,因此应将该最低值视为下限。

推理与电脑使用

学术推理是整张表中最“平”的一行。Humanity's Last Exam 上,Fable 5.1 在无工具与有工具下分别为 60.9% 与 65.0%,Fable 5 分别为 57.8% 与 63.8%,Opus 5 分别为 56.6% 与 63.6%。Anthropic 未公布 GPT-5.6 Sol 在此基准上的成绩。

电脑使用看起来更强,但更难确信。Fable 5.1 在 OSWorld 2.0 上领先:部分设定 77.9%、严格设定 41.7%,而 Opus 5 分别为 75.4% 与 39.6%。Anthropic 按该基准作者在 2026 年 8 月发布的任务集计分,因而这些数值不可与先前发布的 OSWorld 2.0 成绩直接比较,且两款 Fable 模型在防护介入的任务上均计 0 分。

整张表下方有一条总注:在防护阻拦任务的情况下,网络安全相关工作由 Claude Opus 4.8 完成,生物学相关工作由 Claude Opus 5 完成。Anthropic 表示这更可能拉低 Fable 的报告成绩,而非抬高。

应选择哪一档 Claude?

只有当任务足够长、走错一步的代价超过 Token 成本时,Fable 5.1 才是默认之选。对较短的任务,Anthropic 自家其他模型在价格上更具优势、延迟也更低;Sonnet 5 是更明智的日常之选,而非两款旗舰。

Fable 5.1 的价值主要体现在通宵代理运行,而非日常聊天

变体系统有两条轴:Fable 5.1 与 Mythos 5.1 是同一模型,仅防护不同;在二者之上,还有力度设置,分为低、中、高三个级别。Anthropic 报告称,Fable 5.1 在低或中等力度下即可持平或超过 Fable 5,且成本更低,因此力度旋钮更像成本控制而非质量开关。

不同入口的默认设置各异,这点在您基于单次会话下结论前值得了解。Fable 5.1 在 Claude Code 中默认为高力度,在 Claude Cowork 与 Claude.ai 中默认为中等力度,在 Claude API 上默认为 high。

使用场景 选择 原因
耗时数小时的无人值守代理运行 Fable 5.1(高力度) 能在长任务中保持计划一致,且 $0.25 的缓存读取让循环可负担
深入的仓库规划与审查 Opus 5 同为 100 万上下文与自适应思考,价格减半至 $5 / $25,且延迟为中等而非较慢
日常编程与对话 Sonnet 5 $2 / $10 即享 100 万上下文,且 Anthropic 评为快速
高批量或对延迟敏感的工作 Haiku 4.5 $1 / $5,家族中最快,但上下文降至 20 万、最大输出 64K
防御性漏洞研究与生命科学研发 Mythos 5.1 唯一能越过将此类工作重定向到 Opus 模型的防护路径
想用 Fable 做代理,但承担不起高力度 Fable 5.1(低或中等力度) Anthropic 报告称,以更低成本达到不逊于 Fable 5 的结果

Claude Fable 5.1 定价与可用性

Fable 5.1 的价格为每百万输入 Token $10、每百万输出 Token $50,与 Fable 5 完全一致。全部价格变化体现在缓存读取上,下调 75% 至每百万 $0.25。

计费项 每百万 Token 价格
输入 $10
输出 $50
缓存读取 $0.25
缓存写入(5 分钟) $12.50
缓存写入(1 小时) $20
批处理 API 输入与输出五折

Anthropic 估算,按 Token 计费的典型工作负载总体成本约降低 25%,复杂编程与高度具身任务最高可达约 45%。是否将推理 Token 按输出费率计费尚未公布——在此处比在其他模型更关键,因为思考始终开启。

Fable 5.1 现已在各平台普遍可用,包括 AWS、Google Cloud 与 Microsoft Azure。Mythos 5.1 尚未普遍开放:它通过 CVP 与 LSVP 面向经过审查的网络安全防御者与生命科学研究人员,当前为一批美国机构,Anthropic 正与美国政府协作扩大覆盖。

两项较小的开发者相关变更:

  • 自发布日起新创建的 API 账号,将无法在保留早期“思考”记录的同时,编辑 Claude 在多轮会话中的先前上下文——这是一项反蒸馏措施,未来将扩展至所有账号。
  • 依据欧盟《AI 法案》中关于 AI 生成内容透明度的行为准则,Anthropic 对 2026 年 8 月 2 日之后发布的模型输出加注水印,检测 API 现处于私测阶段。

如何获取 Claude Fable 5.1 的使用权限?

开发者调用的模型 ID 为 claude-fable-5-1,自发布日起已在 Claude API 上线。除第一方 API 外,Fable 5.1 也可在 Claude Code、Claude Cowork、Claude.ai 以及主流云上使用,并在 Amazon Bedrock、Google 的 Agent Platform、Microsoft Foundry 等支持 EFS 的入口提供。

最小化调用如下:

from anthropic import Anthropic

client = Anthropic()

response = client.messages.create(
    model="claude-fable-5-1",
    max_tokens=1024,
    messages=[
        {"role": "user", "content": "Trace this crash to its root cause and explain the fix."}
    ],
)

print(response.content[0].text)

完整设置(含成本控制与流式传输)请参阅我们的 Claude API 完整指南。我们的 Claude Fable 5 API 教程 使用 Python 构建开发者任务助手,仅需替换模型 ID;而 Claude Code 最佳实践 文章覆盖了以终端为中心的工作流,其中默认为高力度。

结语

Anthropic 的押注是:前沿不再以聊天轮次计,而以无人值守的时长计;而其对 Fable 5.1 的定价也让这笔赌注变得划算。在维持标价的同时将缓存读取砍掉 75%,比任何一行基准成绩都更有意思,因为它正中唯一能承受 $50 输出费率的工作负载。

我会立刻停用 Fable 5,把日常工作留在 Sonnet 5 或 Opus 5 上。让我犹疑的是 Anthropic 自己的表里散落的那些防护“零分”,以及最醒目的科研成果来自 Mythos 5.1——而几乎没有读者能拿到它。

如果您想在自己的终端里让一款 Fable 级模型派上用场,推荐我们的 Claude Code 101 课程。

常见问题解答

Claude Fable 5.1 与 Claude Opus 5 相比如何?

在 Anthropic 发布的全部基准上,Claude Fable 5.1 均领先 Claude Opus 5,例如在 Terminal-Bench-Science 0.1 上为 52.6% 对 29.0%,在 Terminal-Bench 4.0 上为 55.8% 对 52.3%。不过,Opus 5 的标价仍为 Fable 5.1 的一半,分别为每百万 Token $5 / $25,且 Anthropic 将其延迟评为中等,而 Fable 5.1 更慢。无人值守的长周期代理运行选 Fable 5.1;日常编程与知识工作选 Opus 5。

Claude Fable 5.1 的费用是多少?

Fable 5.1 的价格为每百万输入 Token $10、每百万输出 Token $50,与 Fable 5 保持一致。缓存读取下调 75% 至每百万 $0.25,缓存写入为 5 分钟窗口 $12.50、1 小时窗口 $20;批处理 API 对输入与输出五折。Anthropic 估算,按 Token 计费的典型工作负载总体成本约降 25%,高度具身任务最高约降 45%。

在哪里可以使用 Claude Fable 5.1?

Fable 5.1 已在各平台普遍可用,包括 Amazon Web Services、Google Cloud、Microsoft Azure。开发者可在 Claude API 中以模型 ID claude-fable-5-1 调用,它也可在 Claude Code、Claude Cowork 与 Claude.ai 中使用。

Claude Fable 5.1 与 Claude Mythos 5.1 有何不同?

二者是同一模型,但防护不同。Fable 5.1 面向普遍可用;Mythos 5.1 在网络安全与生命科学方面的防护更宽松,仅向 Anthropic 的网络验证计划(CVP)与生命科学验证计划(LSVP)开放,当前覆盖一批美国机构。防护差异在编程成绩上有所体现:Mythos 5.1 在 Terminal-Bench 4.0 上为 60.9%,而 Fable 5.1 为 55.8%。

使用 Claude Fable 5.1 应该选择哪种力度设置?

Fable 5.1 在 Claude Code 中默认高力度,在 Claude Cowork 与 Claude.ai 中默认中等力度,在 Claude API 中默认为 high。Anthropic 报告称,低或中等力度即可以更低成本达到或超过 Fable 5 的效果,因此较低力度是实打实的成本控制,而非妥协。将高力度保留给长周期代理任务——在这些任务中,走错一步的代价高于 Token 成本。

主题
人工智能
大语言模型

使用 Claude 与 DataCamp 学习!

Courses

Claude 101

2小时
20.9K
Learn how to use Claude for everyday work tasks, understand core features, and explore resources for more advanced learning on other topics.
查看详情Right Arrow
开始课程
查看更多Right Arrow