腾讯 Hy4 preview 发布即引爆排队
Hy4 preview 发布仅 3 天,腾讯 WorkBuddy 就针对其推理集群紧急扩容,官方称将持续动态调配资源。但受限于高端算力总量与高峰并发,个别时段仍可能排队,因此官方推荐用户在 Hy4 preview 排队期间切换至 Hy3,并把 WorkBuddy 的 Hy3 限免延长至 2026 年 9 月 30 日 23:59。
这是腾讯基础模型部成立之后的第一款新模型,也是从头到尾贯彻姚顺雨理念的产品。发布当天(8 月 28 日)API 排队用户就超过 5000 人,而 6 月的数据显示 WorkBuddy 的 MAU 已突破 2000 万。
核心参数与基准成绩
Hy4 preview 公布的关键指标如下:总参数 770B,激活参数 49B,上下文窗口 1M。在 Terminal Bench 2.1 上拿到 85.4 分,官方宣称开源第一、全球第三;SWE-bench Multilingual 得分 82.9,同样标榜开源第一。
| 维度 | Hy4 preview | 口径 |
|---|---|---|
| 总参数 | 770B | — |
| 激活参数 | 49B | — |
| 上下文 | 1M | — |
| Terminal Bench 2.1 | 85.4 | 开源第一、全球第三 |
| SWE-bench Multilingual | 82.9 | 开源第一 |
| 发布首日 API 排队 | 超 5000 人 | 8 月 28 日 |
开源第一的口径如何看
“开源第一、全球第三”这类表述需要留意口径。Terminal Bench 2.1 的 85.4 是开源模型里的头部成绩,但全球范围仍有闭源模型排在前面;SWE-bench Multilingual 的 82.9 同理。论文里腾讯大方标明了 Hy4 preview 使用了哪家的技术、并说明了修改方式——注意力模块用 DeepSeek 的 Gated 与 MTP 层做投机解码,配智谱的 IndexCache 做跨层稀疏索引复用,残差通路用字节的 iHC(identity Hyper-Connections)。换句话说,基础构件并非全部自研,成绩是站在多家开源工作之上的工程整合。
从 Hy3 到 Hy4 的能力跃迁
Hy3 定位“强 Agent 型”模型,已有 ReAct 循环基础、能执行多步骤任务,但缺乏“过度验证”的行为特征,推理更偏单路径——想到一条路就走到黑。Hy4 preview 在推理深度上明显加强:模型会反复自我验证、推理过程偏长,这是 Tree of Thoughts(ToT)思想在系统工程里的体现。混元官方甚至在论文中主动承认,Hy4 preview 在复杂任务上可能思考时间过长,并有过度自我验证的倾向。
三种自进化路线分野
Hy4 preview 的 README 写明灵感来自 DeepSeek 和 GLM,但三家在“自进化”方向上完全不同。
智谱的自进化发生在训练阶段,目标是让模型本身变聪明。GLM-5.3 搭了一条“自己出真题自己做”的流水线:让“AI 研究员”去真实工程师工作场景观察、把业务提炼成训练数据,再让“AI 判卷员”先闭卷做一遍,确认真有解才入题库。配合 SAO 和 slime 框架,GLM-5.3 在不换基座的前提下,长程编码训练速度比 GLM-5.2 提升约 2.3 倍。本质是生物学意义的进化——基因迭代中更适应环境。
DeepSeek 的自进化发生在运行阶段,目标是通过 DSH 让模型“身体”可无限重组。“一切皆插件”,Agent 缺什么现场补什么、用完无痕拆下,官方称为 self-modification。这是工具学意义的进化——人没变,只是更会用工具。
腾讯 Hy4 preview 的自进化既不在训练阶段也不在运行阶段,而在研发流程本身:先定义“我作为 Hy4 preview 应该是什么样”,再朝自己想要的方向发展。在训练方法、数据策略、评估体系、底层算子这四个环节全部引入自进化机制,这是它真正反常的地方。
为什么是姚顺雨统管之后
过去腾讯的大语言模型部和多模态模型部分立,各自有独立训练数据、技术框架、研发流程和评测标准;AI Infra、AI Data、数据计算平台也分别掌管不同数据。7 月合并成基础模型部、姚顺雨一人统管后,这条研发链路才第一次被打通。Hy4 preview 能参与全链路自进化,本身就代表组织已是一条心。
姚顺雨对工程化极其重视。三家之中只有腾讯混元把“底层算子优化”和“推理吞吐量提升”这类关乎实际运行的事纳入自进化列表。他入职后第一件事就是重建基础设施,在 6 月与汤道生对谈中提到“我们把 Infrastructure 重建了,无论是预训练还是强化学习”。即便是 OpenAI 和 Anthropic,算力也是最稀缺资源,汤道生曾公开承认“算力严重不足拖慢了模型训练与产品发展”,姚顺雨必须把每一分算力都榨干。
对腾讯大模型研发的连锁影响
一切核心在于姚顺雨的方法论——Co-design(边训边用,让产品反馈倒逼模型迭代)。Hy3 时期 Co-design 主要发生在模型与产品之间,比如把 CodeBuddy、WorkBuddy 的用户反馈回流到训练;到了 Hy4 preview,Co-design 的范围扩大到整个模型研发流程。训练数据也不再是“给题给答案、省略中间过程”的结果导向,而是通过腾讯内部的软件工程师、游戏开发者、金融分析师、安全专家围绕真实交付工作共建,再与 CodeBuddy、WorkBuddy 共同设计。模型进步的每一格都锚在真实生产力上。
仍待验证的不确定项
几个问题尚待观察。其一,过度自我验证虽提升了复杂任务准确率,但思考时间过长会拖累吞吐与成本,产品体验上是否划算未可知。其二,自进化生成的数据与策略是否存在泛化天花板、会不会在分布外任务上退化。其三,合规与营收——这套高度工程化的闭环能否转化为可持续的商业回报,仍没有答案。混元官方主动承认的“过度验证倾向”,恰恰也是外界评估其边界的入口。
Hy4 是方法论的物质化证明
姚顺雨本身就是语言 Agent 研究的开创者之一:ReAct(2022 年 10 月挂出,ICLR 2023,notable top 5%,引用超 10000 次)是所有 Agent 的工作原理雏形;ToT 则增强了推理中的多路径探索。从 Hy3 到 Hy4 preview,最直观的变化是姚顺雨把他的论文彻底搬进了模型——Hy3 更像能力的印证,Hy4 preview 则让他“转正”。这款模型之所以“更姚顺雨”,不是因为参数变大,而是整个产品逻辑从单路径执行升级到了多路径探索加深度验证。
资料来源:苗正《Hy4Preview,更“姚顺雨”了》,公众号「字母AI」,2026-08-31。
文丨苗正






