研究ai怎么用、怎么赚

Opus 5.5 学姚顺雨混元,GPT-6 Luna 学梁文锋deepseek @字母AI

「阿莫迪偷师姚顺雨,奥特曼偷师梁文锋」

吐槽解读

这篇文章讲的是“抄”,但真正值得记下的不是谁抄了谁,而是定义的权力换手了。过去十年,是硅谷先把范式定下来,中国公司再想办法用更低的成本把它做出来;这一次反了过来——测试时推理、上下文缓存、稀疏注意力这些“省着用”的思路,先在中国公司手里跑通,再被美国巨头拿去工程化。

换句话说,被“偷师”的一方,恰恰是当年算力最吃紧的一方。约束逼出了范式,范式反过来成了全行业的通货——这才是这一轮最反直觉的地方。

Opus 5.5 把智力从权重搬进推理

传统大模型想提升智能只有一条路:在预训练阶段堆数据、堆算力,把“智力”一次性练进模型权重里,然后再反复调用。这条路走到今天,头部公司都撞上了同一堵墙——优质数据几乎被训完,预训练的边际收益开始递减,智能的增量只能另找出口。

维度 要点
Opus 5.5 的新战场 走 test-time 路线,把智力从权重搬进上下文,代价是思考过程吃掉大量 token
姚顺雨的先行论文 2023 年提出思维树与 ReAct,2025 年《The Second Half》判定“下半场拼推理与行动”
GPT-6 Luna 的杀招 缓存复用,缓存命中价 0.01 美元 / 百万 token,比标准输入价便宜 90%
DeepSeek 的底牌 磁盘上下文缓存 + MLA + 稀疏注意力,命中价 0.1 元 / 百万 token,同样便宜 90%
范式反转的落点 预训练见顶,增量转向推理与效率;算力吃紧的一方反而攒出了最硬的工程范式

关键时间线

时间 事件
2023 年 姚顺雨提出 Tree of Thoughts(思维树),同年提出 ReAct 架构,让模型“推理”与“行动”交替
2024 年 DeepSeek V3 落地 MTP(多 token 预测),在主干后挂一个头充当“草稿机”
2025 年 4 月 姚顺雨发表博客《The Second Half》,判断增量正从“训练”挪到“推理与行动”
2026 年 8 月 DeepSeek 上线“Context Caching on Disk”(磁盘上下文缓存),命中价便宜 90%

预训练边际见顶,增量只能从推理里找

预训练路线最怕的是“没见过的题型”。它的泛化本质上是插值:在训练数据覆盖的分布附近表现得很好,一旦遇到需要多步推理、或者干脆在分布外的题目,它就开始瞎编。因为智力全锁在权重里,权重没见过的模式,推理时也补不出来。

另一条路是 test-time 路线:训练完的模型只是个半成品,真正答题时先让它写一大段推理,想得越久、答得越好。智力不再只来自权重,还来自每次调用时现场产生的推理。Opus 5.5 走的就是这条路,官方声明里所有成绩都跑在adaptive thinking at max effort(最大力度的自适应思考)下,而且从这一代起不再提供“关闭 thinking”的选项。

表:同一档位下,每题平均输出的 token(Artificial Analysis 智能指数口径)
模型(档位) 平均每题输出 token 其中“思考” 其中最终答案
Claude Opus 5.5(max) 11.9 万 8.4 万 3.5 万
OpenAI GPT-6 Astra(同档) 2.7 万 — —

注:原榜为 Artificial Analysis 智能指数的“每题平均输出 token”统计;上表取正文披露的数值,第三、四列原文未进一步拆分。

姚顺雨两年前就把这条路画好了

这种“从上下文里找智能”的逻辑,姚顺雨很早就提出过。2023 年,他提出 Tree of Thoughts(思维树),本质就是一种 test-time:推理时展开多条思路,边想边搜索最优解。同年,他又提出 ReAct 架构,让模型的“推理”和“行动”交替进行。

2025 年 4 月,姚顺雨发表博客《The Second Half》。他判断:AI 的上半场拼的是“训练方法与模型”——更大的参数、更多的数据、更强的算力;到了下半场,拼的是“如何使用与评估模型”。他写道:“把推理放进动作空间之后,我们才获得了”针对不同决策灵活分配 test-time compute“的能力。”

他还举过一个盒子实验:桌上有两个盒子,一个有 100 万美元、一个是空的,期望收益就是 50 万;往里面塞进无数个空盒子后,期望收益会越来越低,因为要从无穷多个盒子里挑出那个装钱的。但把“推理”这个动作加进去之后,模型反而更容易选中那个 100 万美元的盒子——挑空盒子的过程本身,就是在为“选中装钱的盒子”做准备。

Opus 5.5,就是把姚顺雨这套理念工程实现了。

GPT-6 Luna 把重复上下文变最便宜

如果说 Opus 5.5 的重点是“怎么想”,那 GPT-6 Luna 的重点就是“怎么便宜地想”。GPT-6 Luna 输入 0.1 美元/百万 token、输出 0.5 美元/百万 token,比上一代 GPT-5.6 Luna 直接砍半;如果缓存命中,读一次缓存只要 0.01 美元/百万 token,比标准输入价便宜 90%。

DeepSeek 早做过的磁盘缓存

模型的每一次调用,都要把你给它的全部上下文“读一遍”——系统提示、长文档、历史对话,一个字都不能少。而这段上下文重复度极高,Agent 每多走一步,前面那一大坨都要重读一遍,长上下文就成了烧钱的黑洞。GPT-6 Luna 用缓存复用来解决这件事:同一段上下文算过一次就存起来,下次直接“读缓存”、不重算,于是“重复的那部分”从最贵变成了最便宜。

但这套动作,DeepSeek 早就做过了。2026 年 8 月 2 日,DeepSeek 上线“Context Caching on Disk”(磁盘上下文缓存),把重复内容缓存在磁盘阵列上,命中时直接取用、跳过重算。当时公告写的缓存命中价是 0.1 元/百万 token,比未命中正好也便宜 90%——和 GPT-6 Luna 一模一样。到了 V4 Flash,命中 0.02 元、未命中 1 元,差 50 倍。

背后的道理很朴素:GPU 显存非常贵,能存的 KV cache 容量有限;而硬盘便宜、容量大,把 KV cache 落到磁盘上,成本就大幅下降。OpenAI 现在的 prompt caching,和 DeepSeek 原理几乎相同——同一段前缀算过一次存起来,下次直接读。

表:GPT-6 Luna 与 DeepSeek 的缓存价格对照
项目 标准输入价 缓存命中价 便宜幅度
GPT-6 Luna 0.1 美元/百万 token 0.01 美元/百万 token 90%
DeepSeek(2026-08 公告) 1 元/百万 token 0.1 元/百万 token 90%
DeepSeek V4 Flash 1 元/百万 token 0.02 元/百万 token 约 50 倍

GPT-6 Luna 与 DeepSeek 的架构同源

不止价格。GPT-6 Luna 的上下文窗口是 105 万 token,DeepSeek V4 是 100 万 token,两边几乎对齐。而100 万上下文的 KV cache,按标准注意力机制来算,一半的模型根本扛不住。

MLA 与推测解码,本质都是“省着用”

为此 DeepSeek 用了 MLA 架构,把 Key 和 Value 联合压缩进一个低维潜空间,缓存那个潜向量、用时再上采样还原。技术报告显示,MLA 把 KV cache 砍掉了 93.3%,生成吞吐提升到 5.76 倍;到了 V4 又叠上压缩稀疏注意力和重度压缩注意力,V4-Pro 在百万 token 上下文下,KV cache 只有上一代 V3.2 的 10%。

除了缓存,OpenAI 还“偷师”了一招:推测解码。官方博客说,他们跑一个更小的 draft(草稿)模型,让它和主模型并行地“猜”接下来几个 token,主模型再批量验收——猜对了,一次前向就能吐好几个 token,token 生成效率提升 15% 以上。而这个思路,2024 年的 DeepSeek V3 就有了,用的是 MTP(Multi-Token Prediction,多 token 预测):在主干模型后面直接挂一个 MTP 头,训练时和主干一起训、共享 hidden state,推理时它知道主模型内部状态长什么样,猜得准、验收通过率高。

虽然实现不同——OpenAI 是外挂一个独立小模型打草稿,DeepSeek 是在主干上长出一个头——但思想是同一个:小的先猜、大的批量验,把串行解码变并行。

表:DeepSeek 在缓存与解码上的关键工程指标
技术 关键指标
MLA(DeepSeek-V2 技术报告) KV cache 砍掉 93.3%,生成吞吐提升到 5.76 倍
压缩稀疏 + 重度压缩注意力(V4) V4-Pro 在百万 token 上下文下,KV cache 仅为 V3.2 的 10%
MTP 多 token 预测(DeepSeek V3,2024) 主干后挂 MTP 头,训练共享 hidden state,推理时充当“草稿机”
推测解码(OpenAI 官方博客) 并行“猜”token、主模型批量验收,token 生成效率提升 15% 以上

这一轮,轮到美国巨头偷师中国

以前,定义模型的是硅谷;国内 AI 公司因为算力有限,只能把这些定义转换成更便宜的解决办法。这一轮,反过来了:学术范式和工程范式都由中国公司先做出来,美国的巨头们负责最后一步——把它做成产品,卖给全世界。

算力吃紧,反而逼出最硬的范式

过去几年,大厂的资源、人才、注意力全部 all in 在预训练这个主战场上,按 Scaling Law 堆数据、堆算力、刷榜单。可当优质数据训练殆尽、预训练边际收益递减之后,行业的增量自然会跑到第二战场——推理时怎么想(test-time compute)、上下文怎么用(context learning)、长上下文怎么便宜(caching / MLA / 稀疏注意力)。

这里还有一个反直觉的地方:主战场上的优势,到了第二战场反而成了累赘。手里攥着最多算力和数据的一方,恰恰最没动力去抠成本、抠效率——“反正堆卡就能解决问题,何必费劲想更聪明的办法”。省显存、省钱这件事,从一开始就不是他们的议题,甚至有点“掉价”。

只有算力吃紧的一方,才会把每一分钱都花在刀刃上。DeepSeek 的 MLA、磁盘缓存、稀疏注意力,本质上都是“穷则思变”,当年只是“没钱的替代方案”,可真到全行业开始拼效率的时候,这些“土办法”忽然成了最硬的通货。

于是就有了今天这一幕:Opus 5.5 与 GPT-6 Luna 齐齐“偷师”中国,把测试时推理和缓存复用做成产品。范式定义权,正在从硅谷向东移。

来源:字母AI 原文链接


  • Opus 5.5 走 test-time 路线、GPT-6 Luna 押注上下文缓存,两个新模型的核心思路都指向姚顺雨与梁文锋早年提出的方向。本文拆解这轮“偷师”背后的技术细节与价格数字。
  • 为什么美国两大 AI 巨头的新模型看起来“很中国”?从思维树、ReAct 到磁盘缓存与 MLA,本文用具体数据和架构细节,讲清这场范式反转是怎么发生的。
  • 预训练边际收益见顶,行业的增量正在从“训练”挪到“推理与效率”。Opus 5.5 与 GPT-6 Luna 的选择,恰好印证了姚顺雨在《The Second Half》里的判断。
  • Opus 5.5 每题平均输出 11.9 万 token,其中 8.4 万是“思考”;GPT-6 Luna 缓存命中价只要 0.01 美元/百万 token。两个数字背后,是同一套中国公司先跑通的工程思路。
  • 2023 年的思维树、ReAct,2025 年的《The Second Half》——姚顺雨很早就提出“智力可以从上下文里找”。Opus 5.5 做的事,正是把这套理念工程实现。
  • GPT-6 Luna 把缓存命中价打到标准输入的十分之一,与 DeepSeek 的磁盘上下文缓存几乎一模一样;到了 V4 Flash,命中与未命中的差距已经拉到 50 倍。
  • 硅谷过去负责定义模型,中国公司负责把定义做成更便宜的实现。这一轮顺序反了:算力吃紧的一方,反而因为“穷则思变”攒出了全行业最硬的工程范式。
  • MLA 把 KV cache 砍掉 93.3%、稀疏注意力让百万 token 上下文的缓存降到上一代的 10%、推测解码把串行输出变成并行——这些“省着用”的技术,正在被美国巨头逐条对齐。
  • Opus 5.5 官方成绩全部跑在“最大力度自适应思考”下,且不再提供关闭 thinking 的选项。这意味着推理过程本身被当成了模型的一部分,成本也随之飙升。
  • 上下文窗口 105 万对 100 万 token,缓存命中价便宜 90% 对便宜 90%,推测解码对 MTP——GPT-6 Luna 与 DeepSeek 在价格和架构上几乎全面对齐,差别只在实现手法。
赞(0) 群聊
文章链接:https://www.tucaod.com/17455.html

讨论群终身200元

永远不解散,不涨价。不荐股、不带单。
ai学习安装,美股分析交流,不构成任何投资建议。终身免费指导。
AI产业链资料库

联系我们

觉得文章有用就可以进群

研究ai怎么用、怎么赚

支付宝扫一扫打赏