「生数科技张金涛:实时生成视频的想象空间有多大」
这场访谈最有信息量的不是“ S2 有多强”,而是张金涛把实时视频的生意逻辑算清楚了:离线视频的需求量等于创作者数量乘以生成需求,实时视频等于总人数乘以交互需求——同一个模型市场,分母完全不同,这才是他敢说“最终能超越语言模型”的底气。
更值得记的是他对“数据比模型大小更重要”的坚持。视频生成圈正在重演语言模型走过的路:架构收敛之后,胜负手从参数规模挪到数据组织与标注质量,生数把宝押在标得细、标得多、标得对上,和语言模型圈“数据质量重于堆料”的判断正在合流。
至于“推理服务本身是赚钱的”,前提是视频模型参数只有语言模型的几十分之一、消费级显卡就能跑实时——成本低才是“使用即消费”能成立的地基。剩下的问题反而不在技术,在产品:陪伴方向的黏性靠的是 Agent 的记忆与理解,不是画质。
生数两个月连发两代实时视频模型
实时生成视频技术路线为什么是一门好生意?
速览
| 维度 | 要点 |
| 受访人 | 张金涛,清华大学朱军教授的00后博士生,SageAttention与TurboDiffusion作者,生数科技S系列负责人 |
| 核心判断 | 实时视频是使用即消费,每个人拥有独立会话,这个市场最终能超越语言模型 |
| S2新能力 | S2-Avatar数字人升级720P、每秒25—40帧;S2-Editing实时改换服装角色背景与画风 |
| 迭代打法 | Refiner一步扩散补画质;Q系列与S系列复用数据基建、模型效果相对独立 |
| 最大难点 | 数据组织与标注,不能只用五秒视频训练出能连续生成几小时的模型 |
| 竞争态势 | 大厂认真做几个月能追到不错水平,短期门槛是时间加认知 |
| 商业路径 | 对外开放API,自研社交陪伴产品,C端驱动消费 |
| 团队规模 | 2026年3月部门成立时只有两人,如今三四十人 |
“选择的方向比努力重要得多。” 在采访里,类似这样笃定的句子张金涛说了很多,对他而言,实时生成视频是一个毋庸置疑的好方向。
大多数人熟悉的视频生成,仍然是输入一段描述,等待模型交付一段视频。实时视频想做的事情有所不同:画面持续生成,用户可以随时开口、输入指令,改变接下来发生的内容,张金涛把这种体验称为 “使用即消费”,意味着每个人拥有属于自己的独立会话,在张金涛看来,人一天里除了看电影、刷短视频,其余时间其实都在进行某种实时的视觉交互,因此这个市场 最终是能完全超越语言模型。
作为清华大学计算机系朱军教授的 00 后博士生,张金涛是注意力加速算子 SageAttention 和视频生成加速框架 TurboDiffusion 的作者,目前在生数科技负责 S 系列实时生成视频模型的研发和所有模型的推理工作。
在实时生成视频模型 S1 发布两个月后,生数推出了升级版的 S2。这次升级包含两个模型:S2-Avatar 可以让数字角色更清晰、更能跟随指令,也支持在交互过程中加入新的参考图;S2-Editing 则可以实时修改输入的视频流,换衣服、换角色、换背景,或者改变画面风格。在 S2 的技术报告里,生数团队还在探索通过 VR 眼镜观看实时空间视频。
张金涛对这个方向很有信心。不仅因为海量需求,还因为成本可控。视频模型的参数规模只有主流大语言模型的几十分之一甚至更小,推理所需的算力相应低得多,而推理,恰恰是张金涛的老本行。
当然,他也不回避眼下的问题,最难的还是竞争。大厂在离线视频模型上已经很强,生数在实时生成视频上的领先身位不是一条不可撼动的竞争护城河。张金涛自己也说,一家数据和训练基础扎实的公司只要 “好好去做”,几个月就能追到不错的水平,生数眼下的优势,很大程度上源于对技术的前瞻性理解,但商业竞争仅仅靠前瞻性还不够。
在这期播客里,我们和张金涛聊了有关实时生成视频的技术进展、商业模式和产品形态,也聊了一个 00 后研究者,如何从一个人埋头写算子,走到带领一支三四十人的团队。
| 时间 | 事件 |
|---|---|
| 2024 年 | 张金涛主要自己写算子:GPU 线程编程、精度对齐,产出 SageAttention 与 TurboDiffusion |
| 2024 底—2025 初 | 萌生创业想法,方向即实时视频生成的基础设施与后训练,接触中美投资机构,其间在伯克利 |
| 2026 年一二月 | 与朱军开始讨论实时方向,看到技术上的可行性,确认路线初步行得通 |
| 2026 年 3 月 | 加入生数科技,部门成立时只有他带两个人,S 系列正式启动 |
| S1 发布 | 发布当天全球用户即可使用、API 直接开放(具体日期原文未给出) |
| S1 两个月后 | S2 发布:S2-Avatar 与 S2-Editing 双模型,720P、每秒 25—40 帧 |
实时视频是使用即消费
以下是经过编辑整理的对话:
晚点:S1 发布才两个月,S2 就来了。新模型有哪些提升?
张金涛:先简单回顾一下 S1。它主要是一个数字人模型,用户上传一张图片,图片里的角色可以是真人、动漫人物,也可以是宠物,再选择一种声音,就可以跟它聊天,让它做一些动作。
S2 包含两个模型。第一个是 S2-Avatar,还是数字人,但真人感更强,指令跟随也更好,包括跳舞这样的大幅度动作。画质提升到了 720P,仍然能保持每秒 25—40 帧的实时生成速度。
我们还引入了一套基于视觉语言模型的 Agent 系统,根据用户的意图和已经生成的视频,规划下一步动作。它支持实时参考生成:你可以在交互的任何一个时刻,输入一张参考图和一条指令。比如给它一张杯子的图片,让它从屏幕下方拿起来,用你指定的姿势展示。
另外一个模型是 S2-Editing,它可以实时地把一段视频流编辑成另一段视频流。比如打开摄像头,给画面里的自己换一套衣服,同时保留动作和背景;也可以把正在玩的游戏,变成二次元或者赛博朋克风格。换背景、换角色,也都可以做。
晚点:实时编辑是生数第一次推出的能力。它和在生成过程中随时输入新的 Prompt,有什么区别?
张金涛:更准确地说,Avatar 和 Editing 都可以在生成过程中接收反馈。你想让人物坐下、去屏幕外拿一个东西、跳舞,这些指令都可以实时地给。这是一个基础能力。
Editing 最主要的功能,是对输入的视频流做实时编辑。这个视频流可以来自摄像头,也可以是游戏或者直播。比如给主播换衣服,甚至换成另一个角色,原来的口型和动作仍然可以对应上。
晚点:在你的设想里,它会以插件的形式出现?
张金涛:可能会作为很多应用的插件。比如你在 Steam 上有 100 个游戏,每个游戏都可以换很多种画面风格,那体验就会丰富很多。
空间视频与 VR 交互
我们还做了一些实时空间视频的探索。Avatar 和 Editing 都有空间视频的版本,可以通过 VR 眼镜观看,也可以实时交互。
实时视频与离线视频,是两种东西
晚点:很多人觉得,实时生成的视频模型,跟我们已经熟悉的视频生成模型,是两种东西。你也这么看吗?
张金涛:我觉得是的。模型上可能有相似之处,但从应用和需求上看,它们很不一样。
目前主流的视频生成,可以理解为离线视频生成:上传一段 Prompt,等一段时间,拿到一个十秒或者十五秒的视频。它主要面向创作者,普通人很少直接使用这些模型。
实时视频的输入和输出都是持续发生的。你希望下一秒发生什么动作、出现什么内容,可以在过程中去控制。它就不只是一个创作工具了,而是 “使用即消费”,每个用户都直接在使用这个模型。
为什么年初就决定投入
晚点:今年初决定投入这个方向,是基于什么判断?
张金涛:首先是需求。人一直都有实时的视觉、多模态交互需求。比如我们今天坐在这里聊天,也是在进行一种实时交互。
如果看离线视频生成,它的需求量可以理解为创作者的数量,乘以每个创作者的生成需求。一段视频可以被很多人反复观看,所以观看需求不会全部转化成生成需求。
但实时交互不一样,每个人都需要自己的会话。它的需求量,是每个人对实时多模态交互的需求,乘以总人数。我觉得这个市场非常大。
第二是技术。今年年初,我们看到了一些技术上的可行性,自己也做过科研探索,发现路线初步行得通。生数又有基础模型的数据和训练系统,可以复用很多积累,这是一加一远大于二的事情。
晚点:这个判断是朱军老师做的,还是你们一起商量的?
张金涛:大的方向判断来自朱老师,具体怎么做,需要一起商量。我们一直交流得比较多,我也会跟他聊一些最新进展,所以当时并没有特别惊讶。大概一二月份开始讨论,三月份正式启动 S 系列。
晚点:朱军老师把通用世界模型分成五级,第一级是生成世界,第二级是与世界交互。S2 对应的是第二级?
张金涛:对,我觉得 Avatar 和 Editing 都符合第二级,就是可以和世界实时发生交互的模型。
有一百种方法可以把它做得更好
晚点:从 S1 到 S2,为什么能迭代得这么快?
张金涛:主要有两点。第一,S 模型需要一套很完整的能力:准备数据、训练模型、推理加速,再到云端部署,每一环都要保证实时性。
流式视频的训练环节也比离线视频更多、更复杂。你要先把离线阶段训好,再逐步把它变成可以实时生成的模型。发布 S1 之前,我们已经把这些问题探索过一遍,有了一套能够运行的基础方案。
所以 S1 发布当天,全球用户就可以使用,API 也直接开放。这背后是数据、训练和工程上的积累。
我们也比较清楚,接下来还有哪些问题要解决。包括现在,我也可以说,S2 还有很多问题,我有一百种方法可以把它做得更好,而且这些方法都非常明确。这两个月,我们主要是把 S1 里最明显的一些问题解决掉了,所以会比较快。
第二是团队。我很以我们的团队为骄傲,大家凝聚力很强,也很有热情,愿意往前冲。做事情自然会快一点。
晚点:所以也可以期待 S3 很快继续迭代?
张金涛:对,没错。
S2 的画质是怎么提上来的
晚点:S1 为了速度,对画质做了一些妥协。S2 的画质提升是怎么实现的?
张金涛:一个重要的方法叫 Refiner。前面有一个基础的实时生成模型,主要生成画面里的结构和低频信息;后面用一个只需要一步扩散计算的 Refiner,把分辨率、细节和美学效果补上去。
另外,推理基础设施也在优化,包括把算子做得更极致,把视频生成的调度做得更好。这些一起带来了画质和效率的提升。
晚点:S 系列和 Q 系列是什么关系?是不是基础模型越好,实时模型就会跟着变好?
张金涛:先给一个结论:Q 系列做得越好,肯定对 S 系列有正向帮助,但这个帮助没有想象中那么直接。不是说基础模型的画质、一致性、复杂镜头做好了,我们直接就能拿到这些收益。
能复用的,首先是数据储备。我们可以从海量数据里,筛选出适合实时交互的部分,比如人物对话。其次是训练和推理的基础设施。
但具体的模型效果,没有那么容易复用。基础模型为了提高效果,往往会扩大模型尺寸,计算量也会上升。实时视频有两个很强的约束:成本要低,生成速度必须比播放速度快。我们很难直接拿一个很大的模型来做实时服务。
另外,实时视频的训练链路很长,效果很大程度上来自自己的后训练阶段,也不能完全依赖基础模型。
晚点:所以是有关联,但相对独立的两条技术路线?
张金涛:对,技术路线上相对独立。
成本与速度,怎么取舍
晚点:成本和速度,哪个更难?如果一定要取舍,你会怎么选?
张金涛:我觉得它们不是一个严格取舍的关系。速度首先是硬指标,你没有办法妥协。不管用什么卡,都必须用少于 0.1 秒的时间,生成一段 0.1 秒的视频,比如用 0.09 秒。
晚点:为什么不是越快越好?比如用 0.01 秒生成出来。
张金涛:因为播放这段 0.1 秒的视频,还是需要 0.1 秒。你即使用 0.01 秒生成好了,也要等这一段播放完。
所以对这里的实时播放来说,首先要达到这个速度要求。成本则是越低越好。我们目前已经可以在消费级显卡上达到实时生成,接下来希望在满足实时性的前提下,把成本继续降低,甚至探索在端侧、更低端的显卡上运行。
数据比模型大小更重要
晚点:回过头看,S 系列最难的地方是什么?
张金涛:难点很多。比如数据,你不可能只用一段段五秒的视频,就把一个能连续生成几个小时的模型训练好。
训练算法也有很多需要探索的地方,我们提出了 Self-Replay Forcing。但如果一定要挑一个最难的,我觉得还是数据:怎么把数据组织成更适合实时视频学习的形式,怎么把它标注好。
“Diffusion 只是一个渲染器”
晚点:之前聊的时候,你说过一句让我印象很深的话,“Diffusion 只是一个渲染器”。你怎么理解这句话?
张金涛:先从需求上看。语言模型要帮人解决复杂任务,所以需要比较强的思考和推理能力。图像、视频生成面对的很多需求,是看电影、刷短视频这样的观看和娱乐需求。
再从比较上层的原理看,Diffusion 学习的是文本到图片、视频的映射。你把信息描述清楚,它把对应的画面生成出来。从这个角度,我把它理解成一个渲染器。
这里最重要的有两件事:第一,训练里的图片和视频质量要好,要符合人的偏好;第二,标注要足够详细、准确,跟画面里的内容对应上。对应得越好,模型学习这个映射就越容易。
晚点:这也解释了为什么你这么看重数据?
张金涛:对。举个例子,你想学 Transformer 的原理,上网找博客。如果看了一百篇写得不好的博客,可能学了五天,还是不知道它到底是什么。
但如果找到一个真正懂原理、又能把事情讲清楚的人写的博客,你可能只看一个小时,就恍然大悟了。
数据起的就是这个作用。模型架构和大小,现在已经相对收敛了。大家大体上都是基于 Transformer 做一些改动,但数据上可以做的事情还有很多。
Scaling Law 还有效吗
晚点:那 Scaling Law 对视频模型还有效吗?模型参数量和后训练继续扩大,会不会带来提升?
张金涛:结论是会,但我觉得不会像语言模型那么有效。直接把模型做大,带来的收益没有语言模型那么明显。
语言模型是智能密集型任务,要解决很多复杂问题。视频生成在我看来,更关键的还是数据。扩大模型当然有用,但相比之下,提升数据质量会更有效。
晚点:实时视频的架构和算法,也已经收敛了吗?
张金涛:架构上相对收敛,总归还是视频生成任务。但算法还没有,我觉得还有很多探索空间。只是跟数据相比,我还是认为数据更重要。
数据是不是护城河
晚点:那数据是不是一个护城河?
张金涛:数据是最关键的一个部分。但它到底能不能成为护城河,多久会被追赶上来,我也很难判断。
晚点:你对生数目前的数据储备满意吗?合成数据会是一个方向吗?
张金涛:目前相对满意,尤其最近三四个月,数据质量、储备和人才密度都有很大提升。当然还有一些细碎的问题,以及认知上的小偏差,我们会继续补。
合成数据是个好方向,但没有那么直接。不是说一下子就能合成大量高质量视频,合成之后也还是要标注。
标注和处理可以依赖视频理解模型,也可以用一些专家模型,比如人脸检测、目标检测、音频分离。这些都能帮助我们把数据处理得更好。
晚点:简单理解,实时视频需要标得更细、标得更多?
张金涛:可以这么理解,但我还要补一点:要更加准确、正确,不能有错误。
竞争对手能不能追上来
晚点:视频生成领域玩家很多,为什么你对实时这个方向这么有信心?
张金涛:把画质做好,把离线创作工具做好,当然有价值,这些积累也会促进实时视频生成。
但实时交互的多模态需求,真的非常大。每个人都有自己的独立会话,跟一百个人、一百万人刷同一条视频,生成需求完全不在一个量级。我觉得,从需求量上说,它最终能超过语言模型。
生数和同行的差别在哪
晚点:跟其他做实时视频的公司相比,生数的差别在哪里?
张金涛:技术路线不会差得特别多。有的专注数字人,有的专注实时编辑,有的专注通用世界探索,做的是一些比较类似的事情。
我觉得我们目前的效果比较领先。技术报告里有一些公开基准上的评测,大家可以看,也可以直接体验。
还有一点是可用性。S1、S2 发布当天,全球用户就能在网页上使用,API 也开放了。现在已经有企业接入我们的 API 做产品。模型究竟做得怎么样,大家用了就可以评价。
无限流直播,怎么看
晚点:最近有人把视频生成模型加速,做成了无限流直播,挺受关注。你怎么评价这件事?
张金涛:先解释一下原理。一个模型可以生成五秒的视频,通过更快的 GPU、推理加速、蒸馏等方法,把生成时间压到五秒以内,就可以让视频连续播下去。
我们之前发布的 TurboDiffusion,已经可以在消费级显卡上用两秒生成五秒的视频。用类似的方法,也可以实现这种效果。我觉得这个应用很有趣。
但生成得快,和能不能实时交互,是两件事。你给它一条 Prompt,它生成得更快了;可你给下一条 Prompt,可能还要等十几秒,甚至二十秒,它才开始生成对应内容。那它还不是我们这里说的实时交互模型。
晚点:生数现在的优势,更多是先发优势,还是技术、数据积累?如果大厂认真做,追赶的难度在哪里?
张金涛:我首先想到的是朱老师的一些前瞻判断,我们在视频生成、实时视频生成上都布局得比较早。公司和朱老师也能把很优秀的人凝聚起来,做同一件事。
当然,头部几家对手都很强,有训练基础、数据储备,也有人才。对于一家有这些基础的公司,我不会说实时视频是一个特别难、别人做不出来的东西。他们认真做,能够做到比较好的水平。
但需要多长时间把数据做好,把训练方法探索清楚,再把工程和基础设施做到一个比较好的状态,很难判断。
晚点:所以短期内,门槛主要还是时间?
张金涛:短期内是时间,以及认知。大家到底觉不觉得,这是一件重要的事情。
现在最大的两个担忧
晚点:那你现在最大的担忧是什么?
张金涛:两个点。第一个还是数据。我们能不能一直在数据标注、数据认知上保持领先?能不能获取最优质的数据源,有很好的视频理解模型做标注,有一套好的数据处理流程?
我担忧这件事,也就会更重视它,把它做好。
第二是产品。实时视频是 “使用即消费”,用户在用的过程中,就已经在消费模型。我们能不能做一款好产品,把生态做好,真正理解用户偏好,再用这些反馈改善模型?能不能让用户愿意持续使用?这些都很重要。
谁会为实时视频买单
晚点:按你的说法,离线视频更像工具,实时视频更像应用,会有生态、用户和黏性。它最终是一个 To C 的模式吗?
张金涛:要看你处在什么位置。生数最主要还是模型提供方。我们会做自己的产品,但只靠我们自己做,肯定比不过让更多人加入进来,用我们的 API 做产品。
所以我们主要是对外提供模型服务。至于实时视频最终的消费和需求,我觉得肯定是 C 端驱动的,因为直接使用它的是每个用户。
最先落地的场景
晚点:实时视频最先落地的场景会是什么?
张金涛:直观上看,直播、电商可能会率先用起来。但我觉得更有潜力的还是陪伴,因为每个人都可能独立地使用它。
社交陪伴产品怎么做
晚点:做一款有用户黏性的产品,在国内是很难的。你们有什么初步想法?
张金涛:我们在准备一款产品,目前产品团队也是我直接管理。主要想做社交、陪伴,解决情感陪伴的需求。
比如在数字人交互里,借助实时参考生成,用户可以用一张图片、一句话,更好地跟角色交互。我们会先把真实的情感需求调研清楚,再去做能够满足这些需求的产品。
晚点:但情感陪伴不是一个新方向。除了形象逼真,用户还希望对方有同理心、有逻辑,甚至觉得它 “有灵魂”。这好像不是实时视频模型能提供的。
张金涛:对。更逼真的视觉形象,加上实时交互,是我们很突出的优势。但比视觉形象更关键的,可能是产品能力,以及背后那套 Agent 的能力:能不能真正懂用户,有没有记忆。
晚点:这些能力来自另一个模型?
张金涛:不完全依赖一个特别强大的模型。简单的图像生成模型和语言模型结合,也可以做得比较好。
用户喜欢一个产品,可能是因为它有趣,能记住之前的会话。这些更多来自对用户的理解,而不只是某一个模型特别强。
晚点:你们一边给 B 端客户提供 API,让他们做应用,一边自己做应用,这两者会不会有点抢?
张金涛:我们提供 API 服务,让大家用模型做产品,同时也做自己的产品,这两件事本身并不冲突。
我们自己做产品,不完全是为了收入。更重要的是建立模型的竞争壁垒:更懂用户的需求,依靠用户反馈和数据闭环,提高模型训练的效果。
晚点:但通过 B 端客户调用 API,不也能回流用户数据吗?
张金涛:还是不够直接,跟用户之间隔了一层。
晚点:所以还是希望通过自己的应用,跟用户建立更直接的连接。
张金涛:对。实时视频是使用即消费,你必须很懂用户,所以我们希望有这样一款产品。
晚点:API 模式在 Coding 领域已经比较明确,但很多视频应用还在探索怎么收费、怎么定价。你怎么看?
张金涛:先看需求。Coding 是每个人都在独立使用,离线视频生成的直接使用者没有那么多。比如我们部门每个人都大量使用 Coding 工具,但你问身边的人用不用视频生成,可能用得就很少。
但也不能说视频模型卖得不好。下游生态的建立需要时间。以前大家就在写代码,现在接入一个 Agent,马上可以写得更快。视频生成下游的应用和创作需求,还没有被完全释放出来。
算力需求大,反而是门好生意
晚点:每个人都有自己的会话,也意味着算力需求跟着用户数量一起增长。这会不会反而不是一门好生意?
张金涛:我觉得恰恰不是,这是更好的一门生意。每个人有独立的会话,需要独立的推理服务,就意味着推理需求会很大。
它确实消耗更多算力,但在我的理解里,推理服务本身是赚钱的。所以使用的用户越多,推理需求越大,赚得也越多。
另外,我们现在可以在消费级显卡上提供实时服务。这样的卡比较常见,所以我觉得,算力供给本身不构成这里的瓶颈。
从写算子到带三四十人的团队
晚点:做 S 系列之前,你主要聚焦推理加速。突然要负责从训练到部署的整条链路,朱军老师第一次让你来做的时候,你是什么感受?
张金涛:很兴奋。我终于能做一番大事业了。
我一直有创业的想法,很想带一支团队,做一件伟大的事情,也觉得自己能做好。我能把事情讲清楚,知道每个人需要什么、适合做什么,怎么把大家凝聚起来,提高团队效率,减少内耗。
做负责人以后,对技术、产品需求的理解也要更深。我觉得这些是我愿意做、也能做好的事情。所以接到这个任务时很开心,到现在也一直很开心。
为带团队做的准备
晚点:当时没有觉得哪些地方特别困难吗?
张金涛:其实在三月份来生数之前,我已经在为带团队做准备了。去年底到今年初,我有过创业的想法,想看看能不能在朱老师支持下,做一些基础设施方面的创业,也跟投资机构聊过。
那段时间我在伯克利,也接触了一些美国的投资机构。到三月份,朱老师问我要不要来生数,这里有更好的资源支持,我觉得很兴奋。做的事情跟我之前想做的,其实很接近。
实时视频就是创业方向
晚点:实时视频就是你当时想创业的方向?
张金涛:是的。当时的商业计划,做的就是实时视频生成的基础设施、后训练,也包括空间视频。
那时候我就跟别人说,选择的方向比努力重要得多。什么是好方向?实时视频生成就是一个好方向。
晚点:现在团队有多少人?从自己写算子,到管理一个团队,最大的变化是什么?
张金涛:大概三四十人。三月份部门刚成立的时候,其实就我带两个人,后来一个一个招进来。
2024 年我主要是自己写算子,做 GPU 线程编程、精度对齐。把一个东西做出来,做到工业界能用,也很开心。
以前关注的是技术细节,每行代码怎么写,把一个东西真正跑通。现在更多是怎么协调团队,让大家朝同一个目标做事,怎么把沟通做好,以及怎么保证自己的认知是正确的、先进的。
晚点:这对你来说,不是特别难的事情?
张金涛:可能确实不是特别难。我感觉自己天生就适合做这种事情。
晚点:天生适合当领导?
张金涛:可能吧,这个不知道。
商业公司还是实验室
晚点:你觉得生数现在更像一家商业公司,还是一个大学实验室?
张金涛:肯定是一家商业公司,这一点毫无疑问。比如做流式视频生成,我们不会做太多纯研究,做的事情要服务业务和收入目标。
但我们确实有比较强的学校、实验室背景,解决问题的思路会更像做研究。我觉得这不是坏处。
晚点:你马上博士毕业了,毕业论文是什么?
张金涛:《高效注意力计算方法研究》,跟推理和训练的基础设施相关,主要面向视频模型。当然,这些注意力算子也可以用在语言模型上。
晚点:主流叙事还是大语言模型。朱军老师也有很多学生在那个方向做得很好,你会觉得可惜吗?
张金涛:不会。我还是坚持刚才的判断,实时视频是一个很好的方向,需求很大。
语言模型帮人解决复杂问题,这当然重要。实时视频解决交流、娱乐这些需求,也很重要。方向不一样,但我没有觉得遗憾,也没有觉得自己应该去做语言模型。
现在画质能打几分
晚点:如果给现在的实时视频画质打个分,相比传统的离线视频生成,做到什么程度了?
张金涛:我觉得大概百分之五六十,还是有比较大的差距。但通过数据和算法上的改进,我觉得这些问题基本都能解决。
明年的期待
晚点:如果明年这个时候再聊,你希望 S 系列长成什么样?
张金涛:我期待它能生成更丰富的内容,画质以假乱真,同时还是实时的、延迟很低,也能准确理解用户意图,精确满足用户需求。
我觉得一年时间,基本够我们把画质做到离线模型百分之八九十的状态。
晚点:最后,还有什么想说的?
张金涛:两个点。第一,我们是很坦诚的。发布第一天,就把模型交给全球用户使用,开放 API。它肯定还不完美,但我们愿意让大家直接用,也欢迎大家提意见。
第二,我们 Vidu S 团队的使命,是为人类极致的多模态交互体验做贡献。这是最终的目标,也是我们一直以来做事情的标准。
有时间的话,大家可以上传一张图片,跟数字人聊聊天,看看它能做什么动作;也可以用 Editing 给自己换换装。
晚点:或者开发一些好玩的案例。
张金涛:对,用我们的模型,做更多好玩的东西。
题图来源:晚点 LatePost
来源:晚点AI 原文链接
- 生数科技张金涛在接受晚点AI访谈时判断,实时生成视频是使用即消费的新品类,每个人拥有属于自己的独立会话,需求量随总人数放大,这个市场最终能完全超越语言模型。
- 张金涛是清华大学朱军教授的00后博士生,SageAttention与TurboDiffusion的作者,如今在生数科技带领三四十人团队,负责S系列实时视频模型的研发与所有模型的推理工作。
- 生数S2包含两个模型:S2-Avatar把数字人画质提升到720P并保持每秒25至40帧实时生成;S2-Editing可以实时改换视频流里的服装、角色、背景与画面风格,口型动作仍能对应。
- 谈到Scaling Law,张金涛认为视频模型继续做大仍有收益但不如语言模型显著,数据质量与标注准确性才是更关键的变量,架构已相对收敛,算法仍有很大探索空间。
- 面对大厂竞争,张金涛坦言实时视频并非做不出来的壁垒,数据和训练基础扎实的公司只要好好去做几个月就能追到不错水平,生数眼下的领先更多来自前瞻认知与数据积累。
- 对于算力焦虑,张金涛给出相反判断:实时视频每人独立会话意味着推理需求随用户增长,而推理服务本身是赚钱的,消费级显卡即可提供实时服务,算力供给不构成瓶颈。
- 落地顺序上,张金涛判断直播与电商会率先用起来,但更有潜力的是情感陪伴,生数正在准备一款社交陪伴产品,先调研清楚真实的情感需求,再做能够满足需求的产品。
- 有人把视频生成模型加速做成无限流直播,张金涛解释这只是把五秒视频的生成时间压进五秒以内让画面连续播放,与真正的实时交互是两回事,下一条Prompt仍要等十几二十秒。
- 速度与成本的关系上,张金涛强调实时生成首先是硬指标:必须用少于0.1秒的时间生成一段0.1秒的视频,之后再谈把成本继续压低,甚至探索端侧与更低端显卡上运行。
- 从一个人埋头写GPU算子,到管理三四十人团队,张金涛说他乐于协调沟通、保持认知先进,其博士论文高效注意力计算方法研究正与推理和训练的基础设施高度相关。







S1 到 S2 才两个月,这迭代速度是真的快啊
选择比努力重要,这句话还挺有分量的👍
按这个节奏,明年这时候真可能以假乱真😮
消费级显卡实时生成已经够强了,他还在讲接下来探索端侧、更低端显卡。真做成了,实时视频就不是云端特权而是人人可用,那个市场才叫真正打开。
晚点这次采访节奏是真的好,之前看别的公司聊实时视频,听半小时也没搞懂它到底实时在哪。。
对照朱老师那个五级世界模型,S2算第二级”与世界交互”,这么一看实时视频就不是”做视频”了,是往世界模型爬的中间形态
这期访谈含金量高,这个嘉宾把实时视频的门道讲得我这种外行也能听懂
00 后带队做 S 系列,这波叫后生可畏
谁懂啊,数字人跳舞终于不鬼畜了
实时交互对推理的要求是持续不断的,跟离线生成完全两种生意
自己下场做产品不为收入、为的是数据闭环和更懂用户,这个思路很正
赛道选得早、技术有积累、团队年轻能打,再加朱军老师坐镇,确实可以
社交陪伴产品还没上线就已经开始期待了
实时视频这个东西,往小了说是让视频变活,往大了说是把人和 AI 的交互变回本能