继续追寻中本聪的脚步

Fable 5.1科研、编码、Agent、安全、商业@Claude

「Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线」

刚刚,Fable 5.1和Mythos 5.1发布!

公开测试数据

8项公开基准测试全部第一,价格最高降45%。尤其是在科学研究和代码这两项上,明显甩开了Fable 5和隔壁GPT-5.6 Sol。换个更直观的视角,现在用中、低推理程度跑Fable 5.1,表现基本相当于老版Mythos 5开到极高甚至最高推理程度。这一波属于是”牢Fable”干掉了”Mythos圣”。

价格方面,Fable 5.1把缓存读取价格降至每百万token 0.25美元,降幅75%。输入和输出价格与Fable 5一致,分别为每百万token 10美元和50美元。看着好像只降了一项价格,但实际影响比较大,因为在智能体任务里,缓存读取占了成本的大头。Anthropic给出的数据是,典型工作负载成本比Fable 5降了大约25%,如果是高度智能体化的任务,最多能省到45%。

官方发布视频有言:

无论你此前让Claude处理什么任务,Fable 5.1都能做更多,并且把最难的部分完成得更出色。

之所以能够做到这点,是因为它擅长处理多步骤任务。这类任务中,假如第二步就出现一个微小错误,到第40步全盘就崩了,而Fable 5.1能够全程稳定输出。如果遇到解决不了的难题,它会告诉你已经尝试过哪些方案、卡在了哪个环节。研究员Flix Rieseberg还特别提到,写作方面Fable 5.1减少使用粗体,也更少使用标题、列表或引号,对风格提示词遵循得更好。

还是老规矩,Fable 5.1面向所有用户开放,Mythos 5.1仅通过受信访问计划提供给经过审核的网络安全和生命科学机构。

能力领域 Benchmark Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Agentic scientific research Terminal-Bench-Science 0.1 52.6% 24.7% 29.0% 22.4%
Agentic coding Terminal-Bench 4.0 55.8%(Mythos 5.1: 60.9%) 42.0% 52.3% 37.3%
Knowledge work GDPval-AA v2 1853 1723 1824 1711
Computer use(partial) OSWorld 2.0 77.9% 72.9% 75.4%
Computer use(strict) OSWorld 2.0 41.7% 36.1% 39.6%
Multidisciplinary reasoning(no tools) Humanity’s Last Exam 60.9% 57.8% 56.6%
Multidisciplinary reasoning(with tools) Humanity’s Last Exam 65.0% 63.8% 63.6%
Business workflows AutomationBench 31.4% 17.1% 26.9% 19.6%
Agentic coding CursorBench 3.2.0 73.4% 70.5% 70.0% 67.2%
Effort 等级 Mythos 5.1 成本(USD) Mythos 5.1 分数 Fable 5.1 成本(USD) Fable 5.1 分数 Mythos 5 成本(USD) Mythos 5 分数
low ≈5.5 42% ≈6 40% ≈5 21%
med ≈8 47% ≈7.5 43% ≈14 33%
high ≈10 57% ≈10 49% ≈17 39%
xhigh ≈14 60% ≈16 51% ≈22 43%
max ≈17 61% ≈18 56% ≈28 46%
Workload 类型 Fable 5 成本(指数=100) Fable 5.1 成本(指数) 降幅
Typical workload(典型) 100 75 −25%
Highly agentic workload(高度智能体化) 100 55 −45%
全文要点速览
章节 核心要点
科研实战:蛋白质设计、生成金星地图、GPU加速 两篇报道的视角互补:量子位以数据立论——8 项公开基准全部第一、缓存读取价格从 1 美元砍到 0.25 美元/百万 …
反蒸馏机制上线 伴随着Fable 5.1发布,还有一些特别的规定和API改动。先简单说说安全方面。…
把Agent推向更长任务 如果只看规格,Fable 5.1并不是一次幅度很大的升级。它延续了Fable 5的100万Token上下文窗口和12…
Fable 5.1之后,Anthropic就要去华尔街了 如果目前的计划没有变化,再过几天,Anthropic可能就要正式把自己的账本摆到华尔街面前。The Informat…
One More Thing A社整这么大动静,隔壁OpenAI肯定坐不住啊。但他们家新模型Astra是真还差一点没弄好,只好先象征性地发点预告。…

科研实战:蛋白质设计、生成金星地图、GPU加速

两篇报道的视角互补:量子位以数据立论——8 项公开基准全部第一、缓存读取价格从 1 美元砍到 0.25 美元/百万 token(降幅 75%,典型工作负载成本约降 25%、高度智能体化任务最多省 45%),并用蛋白质设计(亲和力达竞赛最佳 10 倍)、金星地形图生成、H100 推理提速等科研实战给出硬指标;字母AI则更偏叙事与商业视角,把同一次发布放进”更长任务的 Agent”能力边界、”Claude 进实验室”的科研落地,以及 Anthropic 赴华尔街 IPO(9 月劳动节后公开招股书)的时间窗口里解读,强调它”不是一次大版本升级,而是一次节点性发布”。两者都点出缓存读取降价 75%,但前者回答”强在哪”,后者回答”意味着什么”。

跑分之外,Anthropic还展示了Fable 5.1和Mythos 5.1在科研领域的实战成果。

蛋白质设计方面,Anthropic让Mythos 5.1使用开源蛋白质设计和折叠工具设计高亲和力结合蛋白,并将方案送至两家外部机构做实验验证。在三个靶标上,Mythos 5.1设计的结合亲和力是Adaptyv Bio蛋白质设计竞赛最佳方案的10倍。在全部12个靶标上,命中率接近50%,而当前蛋白质设计领域的典型命中率在10%到15%之间。高亲和力结合蛋白是许多常见药物开发流程中的第一步,直接决定了药物能否在较低剂量下发挥作用。

天文学方面,Fable 5.1基于NASA麦哲伦号30多年前拍摄的雷达图像训练了一个神经网络,为金星三分之一的表面生成了新的高分辨率地形图。此前已有的地形图仅覆盖金星五分之一的面积,分辨率在10到20公里之间。Fable 5.1把分辨率提升到了2至3公里,高度精度比此前提高了25%。这份地图已以CC协议开源发布,供即将到来的NASA VERITAS和ESA EnVision任务参考,帮助确定未来观测的重点地质特征。

计算生物学方面,Mythos 5.1通过编写自定义GPU内核并缓存中间结果,将7个开源深度学习模型的运行速度提升了最高2.5倍,输出完全一致。在实际研究中,生物学家可能需要对这些模型运行数千次,测试每个人类基因附近的所有可能突变,优化后的模型可将GPU成本降低30%到60%。

Model 参数量 任务 加速比
ChromBPNet 6M 2.1-kb DNA sequence 1.6×
Flashzoi 200M 524-kb DNA sequence 1.8×
Enformer 250M 196-kb DNA sequence 1.4×
Profluent-E1 600M 1,024-amino-acid protein 1.6×
ProGen2 6.4B 512-amino-acid protein 2.5×
Evo 2 7B 8-kb DNA sequence 1.6×
Evo 2 40B 8-kb DNA sequence 1.4×

表4|Inference speedup on NVIDIA H100(原图 08;Fable 5.1 优化 kernel,输出完全一致;视觉转录)

Model 任务 原版成本(千美元) 优化后成本(千美元) 节省
Enformer (250M) every mutation, 10-kb window around 20,000 genes $30k $21k −30%
Flashzoi (200M) every mutation, 10-kb window around 20,000 genes $14k $7k −50%
Evo 2 (40B) 3 million ClinVar variants $18k $8k −56%

表5|Estimated cost savings on genome-wide analyses(原图 09;NVIDIA H100 cloud list price;Evo 2 40B 整体任务节省 2.3×;视觉转录)

这类优化通常需要一个性能工程团队花费数周完成,许多学术实验室根本无力负担,而Mythos 5.1仅用数天便做到了,且仅依赖公开源代码。Anthropic计划近期将这些优化开源。

字母AI进一步指出,这里值得注意的并不是Claude又会了一道生物题,它真正做的是一段更完整的科研流程:调用专业工具进行分子设计,再把设计送进真实实验环境验证。类似的事情也发生在计算科学里——从论文、代码到真实实验设备。就在Fable 5.1发布前一周,Anthropic开放了Model Hardware Standard(MHS)的研究预览,希望让AI Agent能够直接操作显微镜、液体处理设备和机械臂等实验室硬件。随着能力往科研和高价值任务里走,Claude开始进入更长的科研流程,这条路甚至已经开始从软件走向真实实验设备。

反蒸馏机制上线

伴随着Fable 5.1发布,还有一些特别的规定和API改动。先简单说说安全方面。

Fable 5.1的网络安全误报率比Fable 5降低了60%,现在允许用于发现软件漏洞,但仍禁止开发漏洞利用程序。渗透测试、漏洞利用生成、基于二进制的漏洞扫描等双重用途任务仍会被重定向到Opus系列模型。基础生物学和医学问题的误报率降低了85%,但涉及生命科学研发的查询仍路由到Opus模型处理,专业人员需通过Mythos 5.1的生命科学验证计划(LSVP)获取访问权限。

然后说重磅的新增反蒸馏机制。从今天起新注册的API账户无法在多轮对话中手动编辑Claude上下文的同时保留思维链记录。之前有一种被公开记录过的常见手法:在多轮对话中,手动篡改Claude之前的上下文,但刻意保留思维链记录。这样一来就能在一组新的、可能带有对抗性的指令下,重放模型在另一组指令下产生的推理过程。现在这条路直接堵死了。

做法是给每个思维链区块都加上一个签名(signature)。当用户在后续请求中把助手的回复发回API时,系统会用这个签名做两件事:验证当前模型是否有权读取这个区块,以及验证这个区块之前的整段对话(包括系统提示词、工具列表、所有历史消息)是否跟当初生成它时一模一样。只要对话中有任何东西被动过,签名校验就会失败。

失败之后怎么处理,取决于开发者设的一个参数 prefix_mismatch_behavior:默认值是”error”,直接返回400状态码,请求被拒;如果设成”drop_block”,系统会静默丢掉这个区块以及它之后的所有思维链,请求本身照常执行。被丢掉的部分不计费,并且会在响应里的 input_transformations 数组中列出来。

哪些操作会触发校验失败?文档给了一份详细清单:编辑、重新排列或删除任何先前的用户/助手/系统消息,改动顶层系统提示词,对工具列表做任何增删改名操作,从对话历史中间抽掉某个思维链区块但保留后面的区块,以及引用了一个在两次请求之间返回了不同内容的图片或文档URL。以上任何一条,都会导致后续所有思维链区块失效。

反过来,有些操作是安全的:在对话末尾追加新消息、从历史记录开头移除思维链区块、改max_tokens之类的请求参数、增减cache_control标记,以及服务端的压缩(compaction)或上下文编辑(context editing),这些都不会触发校验失败。

还有一个链式校验的设计,每个思维链区块会记录它前一个区块的信息,形成一条跨轮次的链条。可以从链条的头部摘掉区块,但如果从中间抽掉一个,那它后面的每一个区块都会跟着失效,整条链从断裂处往后全部作废。

为了不让开发者被卡住,Anthropic同时提供了一系列替代方案,可以在不碰历史记录的前提下达到同样的效果:需要中途改指令?用对话内系统消息(mid-conversation system message)替代直接改顶层提示词;需要每轮加个临时提醒?用带clear_at参数的轮次级系统消息,替代”先插入再删除”的老办法;需要中途增减工具?用tool_addition和tool_removal区块,替代直接编辑工具列表;需要裁剪上下文?用服务端压缩和上下文编辑,替代客户端粗暴截断。

如果你用的是Claude Code、claude.ai、Claude Managed Agents或Claude Agent SDK这些官方产品,什么都不用改,它们已经自动保证对话前缀不会被篡改。但如果你是直接调Messages API的开发者,Anthropic的建议是:把messages数组严格当作只追加(append-only)来用,然后在prefix_mismatch_behavior设为”drop_block”的模式下跑一遍完整的多轮会话测试,看日志里有没有冒出prefix_binding_mismatch条目。

最后文档里还特别提了一个容易踩坑的场景:如果你维护的是一个工具或框架,用户拿自己的API密钥来调用,那新注册用户会更早撞上这个校验。因为开发者自己的密钥大概率是8月31日之前注册的,暂时还没被强制执行。对于这种情况建议主动设好prefix_mismatch_behavior提前测试,别等用户先炸了你才发现。

企业端的安全体系也在同时补齐。字母AI报道,Anthropic同时推出的Enterprise Frontier Safeguards(EFS),就在试图解决Fable级模型过去一个很现实的矛盾:公司既希望保留足够的数据来检测模型滥用,金融、医疗、法律等企业又不愿意把敏感数据交给模型公司长期保存。EFS的办法,是把监控所需要的数据直接存在客户自己控制的云基础设施里,而并非Anthropic的服务器;默认情况下,人工审查也由客户自己完成。Anthropic称,这套机制与超过100家来自金融、医疗、制造、电信、法律等行业的客户共同开发,将从今年秋季开始分阶段上线。从蛋白质设计、金星地图到漏洞发现,再到反蒸馏和企业安全,Fable 5.1展示的不仅仅是一个模型——Anthropic正在模型之外,补上一整套让前沿能力进入科研和企业世界的权限、安全与基础设施。

把Agent推向更长任务

如果只看规格,Fable 5.1并不是一次幅度很大的升级。它延续了Fable 5的100万Token上下文窗口和128K最大输出,基础价格也没有变化:每百万输入Token 10美元,每百万输出Token 50美元。放到当前的旗舰模型阵容里,Fable 5.1依然属于明显更贵的一档:同样按100万输入+100万输出来算,Fable 5.1是GPT-5.6 Sol当前价格的2.5倍,GLM-5.3的10倍以上。

Anthropic官方甚至仍然建议,大多数任务优先从价格只有一半的Opus 5开始,只有面对高难度推理、长时间Agent任务,或者Opus 5在高effort下依然不够用时,再上Fable 5.1。值得关注的变化发生在Agent持续运行的成本上:Fable 5.1的5分钟和1小时缓存写入价格仍然分别是12.5美元和20美元/百万Token,但缓存读取从Fable 5的1美元/百万Token降到了0.25美元,相当于直接砍掉75%。

缓存读取可以理解为:一段上下文已经被模型处理过之后,后面的请求不需要每次重新按完整输入价格读取。对于一次普通问答,这部分未必重要;但一个连续运行几个小时的Agent,会反复读取系统提示词、代码库、工具定义以及此前已经处理过的上下文,任务越长、工具调用越多,缓存读取占到的成本就越高。Anthropic用今年8月四周的实际使用数据做过测算:在按Token计费的场景下,相同任务从Fable 5换到Fable 5.1,典型工作负载的整体成本预计下降约25%;对于上下文更重、工具调用更多的复杂Coding和高度Agent化任务,降幅最高可以达到约45%。

不过,便宜也只是相对于过去,基础价格摆在那里。有开发者就在发布评论区提醒,即使缓存命中率很高,成本依然可能迅速累积,一次真实的复杂Coding任务,就可能花掉20到50美元。Fable 5.1也确实越来越像一个专为长时间任务准备的模型——提升最夸张的是Terminal-Bench-Science 0.1,Fable 5从24.7%提高到52.6%,直接翻倍;测试终端环境Agent能力的Terminal-Bench 4.0从42.0%提高到55.8%,面向复杂商业工作流的AutomationBench则从17.1%提高到31.4%。但如果换到更传统的推理和Coding Benchmark,提升幅度就没有那么夸张:Humanity’s Last Exam不使用工具时从57.8%提高到60.9%,使用工具后从63.8%提高到65.0%;CursorBench 3.2.0从70.5%提高到73.4%;知识工作Benchmark GDPval-AA v2则从1723提高到1853。总体来看,提升明显集中在需要模型连续调用工具、处理多个步骤、检查中间结果再决定下一步行动的任务,而不是在所有能力”均匀分布”。

早期企业测试也在重复这个趋势。Browserbase在其最难的浏览器Agent Benchmark中,让Fable 5.1完成了82%的任务,Opus 5为74%,Fable 5只有57%。Ramp的一次测试里,Fable 5.1在无人干预的情况下连续运行了38个小时:它先发现此前一个机器学习实验的结果其实受到了标签伪影的影响,随后自行修正问题,同时启动6组并行实验跑了一整夜,最后带着新的实验结果和下一步建议回来。在另一次开放式任务中,Ramp只让它寻找”没人负责、但最值得解决的问题”,它自己找到了一个与生产事故有关、尚未有人处理的告警,调取日志并给出了修复方案。Canva给出的反馈则更偏向生成质量:其测试认为Fable 5.1的文字表达更容易理解、也更能遵循写作规范;在与Fable 5的盲测中,Canva更偏好5.1的输出,并且在Canva Code里Fable 5.1直接做出了一个节奏游戏——不仅生成了关卡和真实音乐,还让玩法节奏与音乐拍点对应,这是他们测试过的其他模型都没有做到的。从Benchmark到企业测试,Fable 5.1这次最明显的提升在于,它开始更稳定地把复杂任务完整做完:既能在几十个小时的任务里持续判断、纠错和推进,也能在一次生成里把文字、代码、音乐和交互组织得更完整。

Fable 5.1之后,Anthropic就要去华尔街了

如果目前的计划没有变化,再过几天,Anthropic可能就要正式把自己的账本摆到华尔街面前。The Information最新报道称,Anthropic计划在9月7日美国劳动节之后公开IPO招股书,并在9月中旬举行投资者日,最快可能在9月底至10月初上市。公司已经在6月秘密提交了IPO文件。放在这个时间窗口里,Fable 5.1很自然地成为了Anthropic公开递表前的一次能力展示——毕竟等招股书真正公开之后,华尔街需要判断的可不是Claude能不能再在几个Benchmark里拿到高分,而是Anthropic究竟值多少钱。

今年5月,Anthropic最近一轮私募估值达到9650亿美元;到了8月,《金融时报》采访的多名投资者已经预计,Anthropic上市时的估值可能达到2万亿美元以上,甚至有投资者按照公司增长速度和30倍收入倍数算出了3万亿美元。当然这些都只是投资者自己的估值模型。路透社8月获得的内部财务预测显示,Anthropic预计2028年收入达到1900亿到2000亿美元;年化收入run rate也从2025年底的约90亿美元,增长到今年5月的470亿美元,并在7月底进一步超过650亿美元,二季度初步收入超过115亿美元,是去年同期的14倍以上,并首次录得正的调整后营业利润。华尔街已经开始按照未来几年的价值给它算钱,投行和投资者使用2028年的收入预测计算企业价值/收入倍数,并把Palantir、Cloudflare和SpaceX作为不同维度的参考对象。

就在即将上市的时间点上,Anthropic仍在花大量的钱买GPU、训练模型、做推理和扩张团队。Fable 5.1发布前一周,Anthropic被曝与Nscale签下一份为期六年、价值450亿美元的算力合同,租用西弗吉尼亚州约460MW的数据中心容量;几天后,路透社又披露其与英伟达支持的Lambda签下约350亿美元云计算合同,对应得州Nueces县约350MW的数据中心——仅这两笔新近曝光的算力承诺就达到800亿美元(折合人民币约5377亿元)。

这也让Fable 5.1前面那些看似分散的变化有了另一层意义。一方面,它当然需要继续证明Claude处在前沿;另一方面,只证明”模型更聪明”显然已经不够。蛋白质设计、科研计算、企业Agent、网络安全,以及Enterprise Frontier Safeguards,都在把Claude推向一个方向:进入那些企业本来就愿意花很多钱解决的问题。Fable 5.1降低缓存读取价格也是同样的逻辑——Anthropic没有参加基础Token的低价竞争,而是针对长时间Agent,把典型工作负载的实际成本降低约25%,高度Agent化任务最高降低约45%。模型更强,Agent可以工作得更久;工作时间越长,又必须把单位任务的算力成本压下来。这可能正是Anthropic上市以后最需要证明的一道算术题:增长已经足够快,问题是,在算力承诺也以数百亿美元的速度膨胀时,收入最终能不能跑得比成本更快。Fable 5.1的价值,不只是让Anthropic在递表前再拿下一张漂亮的Benchmark成绩单,从更长时间的Agent,到科研和高价值企业任务,再到缓存降价、安全、权限和基础设施,Anthropic正在试图证明一条更完整的链路:模型能力可以变成工作,工作可以变成收入,而收入最终可以跑赢算力。

One More Thing

A社整这么大动静,隔壁OpenAI肯定坐不住啊。但他们家新模型Astra是真还差一点没弄好,只好先象征性地发点预告。还有Ilya在Fable 5.1和OpenAI Astra发布之际,也少见地出来喊话,呼吁加强网络安全。

资料来源:量子位(微信公众号) | 字母AI《Fable 5.1来了!Anthropic再秀肌肉》 阅读原文 | Anthropic 官方发布


  1. Anthropic 发布 Claude Fable 5.1,在 8 项权威评测中登顶,最高降价 45%,并上线反蒸馏机制,阻止自身能力被蒸馏到其他模型。
  2. 量子位与字母AI实测显示,Fable 5.1 在编程、数学推理、长上下文等 8 项基准全面超越前代,复杂多步任务提升尤其明显。
  3. Fable 5.1 推出企业安全功能 EFS,并显著降低长时 Agent 运行成本,让跑数小时的自动化任务在预算内可行。
  4. 反蒸馏机制是 Fable 5.1 的核心新能力:模型能识别自己正被用于蒸馏训练,并在合规范围内拒绝配合,保护模型权重知识产权。
  5. 新版本把 Agent 推向更长任务,单次会话可连续工作数小时、跨多工具不偏离原始目标,适合软件工程与科研流程。
  6. 缓存命中优化让 Fable 5.1 的长上下文调用成本最高降 45%,大文档分析、代码库问答等场景性价比大幅提升。
  7. MHS 等实验室已把 Claude 接入科研流程,用 Fable 5.1 生成并验证科学假设,加速从文献到实验的闭环。
  8. Fable 5.1 发布带动 Anthropic 估值与 IPO 预期升温,同时与云厂商签下大规模算力采购合同,资本与产业双重关注。
  9. Browserbase、Ramp、Canva 等企业通过 Fable 5.1 重构内部工作流,把浏览器操作、财务分析、设计生产交给长时 Agent 自动完成。
  10. 本文梳理 Fable 5.1 在科研实战、反蒸馏、长时 Agent、成本下降、企业安全与商业影响维度的关键变化,附多张评测数据表。
赞(0) 群聊
文章链接:https://www.tucaod.com/17023.html

讨论群终身200元

永远不解散,不涨价。不荐股、不带单。
ai学习安装,美股分析交流,不构成任何投资建议。终身免费指导。
AI产业链资料库

联系我们

觉得文章有用就可以进群

继续追寻中本聪的脚步

支付宝扫一扫打赏