「Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线」
刚刚,Fable 5.1和Mythos 5.1发布!
公开测试数据
8项公开基准测试全部第一,价格最高降45%。尤其是在科学研究和代码这两项上,明显甩开了Fable 5和隔壁GPT-5.6 Sol。换个更直观的视角,现在用中、低推理程度跑Fable 5.1,表现基本相当于老版Mythos 5开到极高甚至最高推理程度。这一波属于是”牢Fable”干掉了”Mythos圣”。
价格方面,Fable 5.1把缓存读取价格降至每百万token 0.25美元,降幅75%。输入和输出价格与Fable 5一致,分别为每百万token 10美元和50美元。看着好像只降了一项价格,但实际影响比较大,因为在智能体任务里,缓存读取占了成本的大头。Anthropic给出的数据是,典型工作负载成本比Fable 5降了大约25%,如果是高度智能体化的任务,最多能省到45%。
官方发布视频有言:
无论你此前让Claude处理什么任务,Fable 5.1都能做更多,并且把最难的部分完成得更出色。
之所以能够做到这点,是因为它擅长处理多步骤任务。这类任务中,假如第二步就出现一个微小错误,到第40步全盘就崩了,而Fable 5.1能够全程稳定输出。如果遇到解决不了的难题,它会告诉你已经尝试过哪些方案、卡在了哪个环节。研究员Flix Rieseberg还特别提到,写作方面Fable 5.1减少使用粗体,也更少使用标题、列表或引号,对风格提示词遵循得更好。
还是老规矩,Fable 5.1面向所有用户开放,Mythos 5.1仅通过受信访问计划提供给经过审核的网络安全和生命科学机构。
| 能力领域 | Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Agentic scientific research | Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| Agentic coding | Terminal-Bench 4.0 | 55.8%(Mythos 5.1: 60.9%) | 42.0% | 52.3% | 37.3% |
| Knowledge work | GDPval-AA v2 | 1853 | 1723 | 1824 | 1711 |
| Computer use(partial) | OSWorld 2.0 | 77.9% | 72.9% | 75.4% | — |
| Computer use(strict) | OSWorld 2.0 | 41.7% | 36.1% | 39.6% | — |
| Multidisciplinary reasoning(no tools) | Humanity’s Last Exam | 60.9% | 57.8% | 56.6% | — |
| Multidisciplinary reasoning(with tools) | Humanity’s Last Exam | 65.0% | 63.8% | 63.6% | — |
| Business workflows | AutomationBench | 31.4% | 17.1% | 26.9% | 19.6% |
| Agentic coding | CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% |
| Effort 等级 | Mythos 5.1 成本(USD) | Mythos 5.1 分数 | Fable 5.1 成本(USD) | Fable 5.1 分数 | Mythos 5 成本(USD) | Mythos 5 分数 |
|---|---|---|---|---|---|---|
| low | ≈5.5 | 42% | ≈6 | 40% | ≈5 | 21% |
| med | ≈8 | 47% | ≈7.5 | 43% | ≈14 | 33% |
| high | ≈10 | 57% | ≈10 | 49% | ≈17 | 39% |
| xhigh | ≈14 | 60% | ≈16 | 51% | ≈22 | 43% |
| max | ≈17 | 61% | ≈18 | 56% | ≈28 | 46% |
| Workload 类型 | Fable 5 成本(指数=100) | Fable 5.1 成本(指数) | 降幅 |
|---|---|---|---|
| Typical workload(典型) | 100 | 75 | −25% |
| Highly agentic workload(高度智能体化) | 100 | 55 | −45% |
| 章节 | 核心要点 |
|---|---|
| 科研实战:蛋白质设计、生成金星地图、GPU加速 | 两篇报道的视角互补:量子位以数据立论——8 项公开基准全部第一、缓存读取价格从 1 美元砍到 0.25 美元/百万 … |
| 反蒸馏机制上线 | 伴随着Fable 5.1发布,还有一些特别的规定和API改动。先简单说说安全方面。… |
| 把Agent推向更长任务 | 如果只看规格,Fable 5.1并不是一次幅度很大的升级。它延续了Fable 5的100万Token上下文窗口和12… |
| Fable 5.1之后,Anthropic就要去华尔街了 | 如果目前的计划没有变化,再过几天,Anthropic可能就要正式把自己的账本摆到华尔街面前。The Informat… |
| One More Thing | A社整这么大动静,隔壁OpenAI肯定坐不住啊。但他们家新模型Astra是真还差一点没弄好,只好先象征性地发点预告。… |
科研实战:蛋白质设计、生成金星地图、GPU加速
两篇报道的视角互补:量子位以数据立论——8 项公开基准全部第一、缓存读取价格从 1 美元砍到 0.25 美元/百万 token(降幅 75%,典型工作负载成本约降 25%、高度智能体化任务最多省 45%),并用蛋白质设计(亲和力达竞赛最佳 10 倍)、金星地形图生成、H100 推理提速等科研实战给出硬指标;字母AI则更偏叙事与商业视角,把同一次发布放进”更长任务的 Agent”能力边界、”Claude 进实验室”的科研落地,以及 Anthropic 赴华尔街 IPO(9 月劳动节后公开招股书)的时间窗口里解读,强调它”不是一次大版本升级,而是一次节点性发布”。两者都点出缓存读取降价 75%,但前者回答”强在哪”,后者回答”意味着什么”。
跑分之外,Anthropic还展示了Fable 5.1和Mythos 5.1在科研领域的实战成果。
蛋白质设计方面,Anthropic让Mythos 5.1使用开源蛋白质设计和折叠工具设计高亲和力结合蛋白,并将方案送至两家外部机构做实验验证。在三个靶标上,Mythos 5.1设计的结合亲和力是Adaptyv Bio蛋白质设计竞赛最佳方案的10倍。在全部12个靶标上,命中率接近50%,而当前蛋白质设计领域的典型命中率在10%到15%之间。高亲和力结合蛋白是许多常见药物开发流程中的第一步,直接决定了药物能否在较低剂量下发挥作用。
天文学方面,Fable 5.1基于NASA麦哲伦号30多年前拍摄的雷达图像训练了一个神经网络,为金星三分之一的表面生成了新的高分辨率地形图。此前已有的地形图仅覆盖金星五分之一的面积,分辨率在10到20公里之间。Fable 5.1把分辨率提升到了2至3公里,高度精度比此前提高了25%。这份地图已以CC协议开源发布,供即将到来的NASA VERITAS和ESA EnVision任务参考,帮助确定未来观测的重点地质特征。
计算生物学方面,Mythos 5.1通过编写自定义GPU内核并缓存中间结果,将7个开源深度学习模型的运行速度提升了最高2.5倍,输出完全一致。在实际研究中,生物学家可能需要对这些模型运行数千次,测试每个人类基因附近的所有可能突变,优化后的模型可将GPU成本降低30%到60%。
| Model | 参数量 | 任务 | 加速比 |
|---|---|---|---|
| ChromBPNet | 6M | 2.1-kb DNA sequence | 1.6× |
| Flashzoi | 200M | 524-kb DNA sequence | 1.8× |
| Enformer | 250M | 196-kb DNA sequence | 1.4× |
| Profluent-E1 | 600M | 1,024-amino-acid protein | 1.6× |
| ProGen2 | 6.4B | 512-amino-acid protein | 2.5× |
| Evo 2 | 7B | 8-kb DNA sequence | 1.6× |
| Evo 2 | 40B | 8-kb DNA sequence | 1.4× |
表4|Inference speedup on NVIDIA H100(原图 08;Fable 5.1 优化 kernel,输出完全一致;视觉转录)
| Model | 任务 | 原版成本(千美元) | 优化后成本(千美元) | 节省 |
|---|---|---|---|---|
| Enformer (250M) | every mutation, 10-kb window around 20,000 genes | $30k | $21k | −30% |
| Flashzoi (200M) | every mutation, 10-kb window around 20,000 genes | $14k | $7k | −50% |
| Evo 2 (40B) | 3 million ClinVar variants | $18k | $8k | −56% |
表5|Estimated cost savings on genome-wide analyses(原图 09;NVIDIA H100 cloud list price;Evo 2 40B 整体任务节省 2.3×;视觉转录)
这类优化通常需要一个性能工程团队花费数周完成,许多学术实验室根本无力负担,而Mythos 5.1仅用数天便做到了,且仅依赖公开源代码。Anthropic计划近期将这些优化开源。
字母AI进一步指出,这里值得注意的并不是Claude又会了一道生物题,它真正做的是一段更完整的科研流程:调用专业工具进行分子设计,再把设计送进真实实验环境验证。类似的事情也发生在计算科学里——从论文、代码到真实实验设备。就在Fable 5.1发布前一周,Anthropic开放了Model Hardware Standard(MHS)的研究预览,希望让AI Agent能够直接操作显微镜、液体处理设备和机械臂等实验室硬件。随着能力往科研和高价值任务里走,Claude开始进入更长的科研流程,这条路甚至已经开始从软件走向真实实验设备。
反蒸馏机制上线
伴随着Fable 5.1发布,还有一些特别的规定和API改动。先简单说说安全方面。
Fable 5.1的网络安全误报率比Fable 5降低了60%,现在允许用于发现软件漏洞,但仍禁止开发漏洞利用程序。渗透测试、漏洞利用生成、基于二进制的漏洞扫描等双重用途任务仍会被重定向到Opus系列模型。基础生物学和医学问题的误报率降低了85%,但涉及生命科学研发的查询仍路由到Opus模型处理,专业人员需通过Mythos 5.1的生命科学验证计划(LSVP)获取访问权限。
然后说重磅的新增反蒸馏机制。从今天起新注册的API账户无法在多轮对话中手动编辑Claude上下文的同时保留思维链记录。之前有一种被公开记录过的常见手法:在多轮对话中,手动篡改Claude之前的上下文,但刻意保留思维链记录。这样一来就能在一组新的、可能带有对抗性的指令下,重放模型在另一组指令下产生的推理过程。现在这条路直接堵死了。
做法是给每个思维链区块都加上一个签名(signature)。当用户在后续请求中把助手的回复发回API时,系统会用这个签名做两件事:验证当前模型是否有权读取这个区块,以及验证这个区块之前的整段对话(包括系统提示词、工具列表、所有历史消息)是否跟当初生成它时一模一样。只要对话中有任何东西被动过,签名校验就会失败。
失败之后怎么处理,取决于开发者设的一个参数 prefix_mismatch_behavior:默认值是”error”,直接返回400状态码,请求被拒;如果设成”drop_block”,系统会静默丢掉这个区块以及它之后的所有思维链,请求本身照常执行。被丢掉的部分不计费,并且会在响应里的 input_transformations 数组中列出来。
哪些操作会触发校验失败?文档给了一份详细清单:编辑、重新排列或删除任何先前的用户/助手/系统消息,改动顶层系统提示词,对工具列表做任何增删改名操作,从对话历史中间抽掉某个思维链区块但保留后面的区块,以及引用了一个在两次请求之间返回了不同内容的图片或文档URL。以上任何一条,都会导致后续所有思维链区块失效。
反过来,有些操作是安全的:在对话末尾追加新消息、从历史记录开头移除思维链区块、改max_tokens之类的请求参数、增减cache_control标记,以及服务端的压缩(compaction)或上下文编辑(context editing),这些都不会触发校验失败。
还有一个链式校验的设计,每个思维链区块会记录它前一个区块的信息,形成一条跨轮次的链条。可以从链条的头部摘掉区块,但如果从中间抽掉一个,那它后面的每一个区块都会跟着失效,整条链从断裂处往后全部作废。
为了不让开发者被卡住,Anthropic同时提供了一系列替代方案,可以在不碰历史记录的前提下达到同样的效果:需要中途改指令?用对话内系统消息(mid-conversation system message)替代直接改顶层提示词;需要每轮加个临时提醒?用带clear_at参数的轮次级系统消息,替代”先插入再删除”的老办法;需要中途增减工具?用tool_addition和tool_removal区块,替代直接编辑工具列表;需要裁剪上下文?用服务端压缩和上下文编辑,替代客户端粗暴截断。
如果你用的是Claude Code、claude.ai、Claude Managed Agents或Claude Agent SDK这些官方产品,什么都不用改,它们已经自动保证对话前缀不会被篡改。但如果你是直接调Messages API的开发者,Anthropic的建议是:把messages数组严格当作只追加(append-only)来用,然后在prefix_mismatch_behavior设为”drop_block”的模式下跑一遍完整的多轮会话测试,看日志里有没有冒出prefix_binding_mismatch条目。
最后文档里还特别提了一个容易踩坑的场景:如果你维护的是一个工具或框架,用户拿自己的API密钥来调用,那新注册用户会更早撞上这个校验。因为开发者自己的密钥大概率是8月31日之前注册的,暂时还没被强制执行。对于这种情况建议主动设好prefix_mismatch_behavior提前测试,别等用户先炸了你才发现。
企业端的安全体系也在同时补齐。字母AI报道,Anthropic同时推出的Enterprise Frontier Safeguards(EFS),就在试图解决Fable级模型过去一个很现实的矛盾:公司既希望保留足够的数据来检测模型滥用,金融、医疗、法律等企业又不愿意把敏感数据交给模型公司长期保存。EFS的办法,是把监控所需要的数据直接存在客户自己控制的云基础设施里,而并非Anthropic的服务器;默认情况下,人工审查也由客户自己完成。Anthropic称,这套机制与超过100家来自金融、医疗、制造、电信、法律等行业的客户共同开发,将从今年秋季开始分阶段上线。从蛋白质设计、金星地图到漏洞发现,再到反蒸馏和企业安全,Fable 5.1展示的不仅仅是一个模型——Anthropic正在模型之外,补上一整套让前沿能力进入科研和企业世界的权限、安全与基础设施。
把Agent推向更长任务
如果只看规格,Fable 5.1并不是一次幅度很大的升级。它延续了Fable 5的100万Token上下文窗口和128K最大输出,基础价格也没有变化:每百万输入Token 10美元,每百万输出Token 50美元。放到当前的旗舰模型阵容里,Fable 5.1依然属于明显更贵的一档:同样按100万输入+100万输出来算,Fable 5.1是GPT-5.6 Sol当前价格的2.5倍,GLM-5.3的10倍以上。
Anthropic官方甚至仍然建议,大多数任务优先从价格只有一半的Opus 5开始,只有面对高难度推理、长时间Agent任务,或者Opus 5在高effort下依然不够用时,再上Fable 5.1。值得关注的变化发生在Agent持续运行的成本上:Fable 5.1的5分钟和1小时缓存写入价格仍然分别是12.5美元和20美元/百万Token,但缓存读取从Fable 5的1美元/百万Token降到了0.25美元,相当于直接砍掉75%。
缓存读取可以理解为:一段上下文已经被模型处理过之后,后面的请求不需要每次重新按完整输入价格读取。对于一次普通问答,这部分未必重要;但一个连续运行几个小时的Agent,会反复读取系统提示词、代码库、工具定义以及此前已经处理过的上下文,任务越长、工具调用越多,缓存读取占到的成本就越高。Anthropic用今年8月四周的实际使用数据做过测算:在按Token计费的场景下,相同任务从Fable 5换到Fable 5.1,典型工作负载的整体成本预计下降约25%;对于上下文更重、工具调用更多的复杂Coding和高度Agent化任务,降幅最高可以达到约45%。
不过,便宜也只是相对于过去,基础价格摆在那里。有开发者就在发布评论区提醒,即使缓存命中率很高,成本依然可能迅速累积,一次真实的复杂Coding任务,就可能花掉20到50美元。Fable 5.1也确实越来越像一个专为长时间任务准备的模型——提升最夸张的是Terminal-Bench-Science 0.1,Fable 5从24.7%提高到52.6%,直接翻倍;测试终端环境Agent能力的Terminal-Bench 4.0从42.0%提高到55.8%,面向复杂商业工作流的AutomationBench则从17.1%提高到31.4%。但如果换到更传统的推理和Coding Benchmark,提升幅度就没有那么夸张:Humanity’s Last Exam不使用工具时从57.8%提高到60.9%,使用工具后从63.8%提高到65.0%;CursorBench 3.2.0从70.5%提高到73.4%;知识工作Benchmark GDPval-AA v2则从1723提高到1853。总体来看,提升明显集中在需要模型连续调用工具、处理多个步骤、检查中间结果再决定下一步行动的任务,而不是在所有能力”均匀分布”。
早期企业测试也在重复这个趋势。Browserbase在其最难的浏览器Agent Benchmark中,让Fable 5.1完成了82%的任务,Opus 5为74%,Fable 5只有57%。Ramp的一次测试里,Fable 5.1在无人干预的情况下连续运行了38个小时:它先发现此前一个机器学习实验的结果其实受到了标签伪影的影响,随后自行修正问题,同时启动6组并行实验跑了一整夜,最后带着新的实验结果和下一步建议回来。在另一次开放式任务中,Ramp只让它寻找”没人负责、但最值得解决的问题”,它自己找到了一个与生产事故有关、尚未有人处理的告警,调取日志并给出了修复方案。Canva给出的反馈则更偏向生成质量:其测试认为Fable 5.1的文字表达更容易理解、也更能遵循写作规范;在与Fable 5的盲测中,Canva更偏好5.1的输出,并且在Canva Code里Fable 5.1直接做出了一个节奏游戏——不仅生成了关卡和真实音乐,还让玩法节奏与音乐拍点对应,这是他们测试过的其他模型都没有做到的。从Benchmark到企业测试,Fable 5.1这次最明显的提升在于,它开始更稳定地把复杂任务完整做完:既能在几十个小时的任务里持续判断、纠错和推进,也能在一次生成里把文字、代码、音乐和交互组织得更完整。
Fable 5.1之后,Anthropic就要去华尔街了
如果目前的计划没有变化,再过几天,Anthropic可能就要正式把自己的账本摆到华尔街面前。The Information最新报道称,Anthropic计划在9月7日美国劳动节之后公开IPO招股书,并在9月中旬举行投资者日,最快可能在9月底至10月初上市。公司已经在6月秘密提交了IPO文件。放在这个时间窗口里,Fable 5.1很自然地成为了Anthropic公开递表前的一次能力展示——毕竟等招股书真正公开之后,华尔街需要判断的可不是Claude能不能再在几个Benchmark里拿到高分,而是Anthropic究竟值多少钱。
今年5月,Anthropic最近一轮私募估值达到9650亿美元;到了8月,《金融时报》采访的多名投资者已经预计,Anthropic上市时的估值可能达到2万亿美元以上,甚至有投资者按照公司增长速度和30倍收入倍数算出了3万亿美元。当然这些都只是投资者自己的估值模型。路透社8月获得的内部财务预测显示,Anthropic预计2028年收入达到1900亿到2000亿美元;年化收入run rate也从2025年底的约90亿美元,增长到今年5月的470亿美元,并在7月底进一步超过650亿美元,二季度初步收入超过115亿美元,是去年同期的14倍以上,并首次录得正的调整后营业利润。华尔街已经开始按照未来几年的价值给它算钱,投行和投资者使用2028年的收入预测计算企业价值/收入倍数,并把Palantir、Cloudflare和SpaceX作为不同维度的参考对象。
就在即将上市的时间点上,Anthropic仍在花大量的钱买GPU、训练模型、做推理和扩张团队。Fable 5.1发布前一周,Anthropic被曝与Nscale签下一份为期六年、价值450亿美元的算力合同,租用西弗吉尼亚州约460MW的数据中心容量;几天后,路透社又披露其与英伟达支持的Lambda签下约350亿美元云计算合同,对应得州Nueces县约350MW的数据中心——仅这两笔新近曝光的算力承诺就达到800亿美元(折合人民币约5377亿元)。
这也让Fable 5.1前面那些看似分散的变化有了另一层意义。一方面,它当然需要继续证明Claude处在前沿;另一方面,只证明”模型更聪明”显然已经不够。蛋白质设计、科研计算、企业Agent、网络安全,以及Enterprise Frontier Safeguards,都在把Claude推向一个方向:进入那些企业本来就愿意花很多钱解决的问题。Fable 5.1降低缓存读取价格也是同样的逻辑——Anthropic没有参加基础Token的低价竞争,而是针对长时间Agent,把典型工作负载的实际成本降低约25%,高度Agent化任务最高降低约45%。模型更强,Agent可以工作得更久;工作时间越长,又必须把单位任务的算力成本压下来。这可能正是Anthropic上市以后最需要证明的一道算术题:增长已经足够快,问题是,在算力承诺也以数百亿美元的速度膨胀时,收入最终能不能跑得比成本更快。Fable 5.1的价值,不只是让Anthropic在递表前再拿下一张漂亮的Benchmark成绩单,从更长时间的Agent,到科研和高价值企业任务,再到缓存降价、安全、权限和基础设施,Anthropic正在试图证明一条更完整的链路:模型能力可以变成工作,工作可以变成收入,而收入最终可以跑赢算力。
One More Thing
A社整这么大动静,隔壁OpenAI肯定坐不住啊。但他们家新模型Astra是真还差一点没弄好,只好先象征性地发点预告。还有Ilya在Fable 5.1和OpenAI Astra发布之际,也少见地出来喊话,呼吁加强网络安全。
资料来源:量子位(微信公众号) | 字母AI《Fable 5.1来了!Anthropic再秀肌肉》 阅读原文 | Anthropic 官方发布
- Anthropic 发布 Claude Fable 5.1,在 8 项权威评测中登顶,最高降价 45%,并上线反蒸馏机制,阻止自身能力被蒸馏到其他模型。
- 量子位与字母AI实测显示,Fable 5.1 在编程、数学推理、长上下文等 8 项基准全面超越前代,复杂多步任务提升尤其明显。
- Fable 5.1 推出企业安全功能 EFS,并显著降低长时 Agent 运行成本,让跑数小时的自动化任务在预算内可行。
- 反蒸馏机制是 Fable 5.1 的核心新能力:模型能识别自己正被用于蒸馏训练,并在合规范围内拒绝配合,保护模型权重知识产权。
- 新版本把 Agent 推向更长任务,单次会话可连续工作数小时、跨多工具不偏离原始目标,适合软件工程与科研流程。
- 缓存命中优化让 Fable 5.1 的长上下文调用成本最高降 45%,大文档分析、代码库问答等场景性价比大幅提升。
- MHS 等实验室已把 Claude 接入科研流程,用 Fable 5.1 生成并验证科学假设,加速从文献到实验的闭环。
- Fable 5.1 发布带动 Anthropic 估值与 IPO 预期升温,同时与云厂商签下大规模算力采购合同,资本与产业双重关注。
- Browserbase、Ramp、Canva 等企业通过 Fable 5.1 重构内部工作流,把浏览器操作、财务分析、设计生产交给长时 Agent 自动完成。
- 本文梳理 Fable 5.1 在科研实战、反蒸馏、长时 Agent、成本下降、企业安全与商业影响维度的关键变化,附多张评测数据表。






