继续追寻中本聪的脚步

DeepSeek V4.1 Flash 内测:40天换架构、价格没涨@字符AI

「V4.1 Flash 内测,梁文锋又当回了梁圣」

V4.1 Flash 内测登场:40 天改架构、调用价不变

V4.1 Flash 中间版本 0910 到期;40 天换代架构,价格却原地踏步

DeepSeek V4.1 Flash 的中间版本 deepseek-v4.1-flash-expires-on-0910 突然开启内测,测试期到 9 月 10 日。官方表态 「采用了新的模型结构,原生多模态支持、能力更强、速度更快、且成本更低」,既没技术报告也没参数表,但透露出来的信息已经够炸。

V4.1 Flash 是 DeepSeek 第一款原生多模态模型——V4 Flash Vision-Exp 的多模态是「外挂式」:在 V4 Flash 0731 纯文本底座上,外接一个视觉编码器加一个对齐器;而 V4.1 Flash 是出厂就自带图文一体化输入输出

更离谱的是节奏:V4 正式版到 V4.1 才过了 40 天,就采用新结构,还能在提高性能的时候降低成本——这难道不该叫 V5 Flash?

维度 关键数据 含义
架构 V4.1=原生多模态;V4 视觉=外挂 40 天换代架构,V5 提前?
速度(轻负载) 思考 0.3s / 159.3 token·s⁻¹ / 端到端 0.8s 「你好」实测
速度(重负载) 420 token·s⁻¹ / 端到端 409.5 token·s⁻¹ 长文本推理
同任务提升 5.2× / 6.0× / 4.6× / 5.0× / 3.9× 相对 V4 Vision-Exp(5 类任务)
价格 与 V4 Flash 相同 性能暴涨、不涨价
招聘 150 人 HC:服务端开发 + Agent 弹性计算 2-10 年资深优先,应届亦招

速度实测:159.3 token/秒是起点,重度负载跑到 420

在经过社区多位技术博主测试后,即使只是中间版本,它的表现也相当惊艳。最直观的对比是「你好」测试:以往跟大模型对话 界面要跳动一两秒思考指示器,在 V4.1 Flash 上模型 思考时间只有 0.3 秒,生成速率瞬间飙到每秒 159.3 个 token,整轮对话端到端耗时仅 0.8 秒

另一组重度长文本推理的实测截图里,模型生成速度直接快到每秒 420 个 token,端到端吞吐达 409.5 token/秒

业内人调侃:「这吞吐量直接把别家所谓的极速模式(Highspeed)做成了自己的日常基准」。

扩招 150 人:DeepSeek 的「成人礼」

就在 V4.1 Flash 发布前一天,DeepSeek 突然宣布释放 150 人招聘名额,明确面向 2-10 年资深工程师,同时兼顾应届生与新锐人才。两个方向:服务端开发工程师(大模型研究平台、Agent 框架组件、研发效率基建、DeepSeek API、线上服务、数据工程)和 Agent 弹性计算研发工程师(平台开发维护、底层调优攻坚)

DeepSeek Harness 负责人崔添翼发文:这次扩招绝不是为了做常规业务堆人,而是因为「量的激增引发了复杂度的指数级爆炸」

从作坊到企业:复杂度爆炸倒逼工程升级

过去大众认知里,DeepSeek 是几十个算法天才组成的「特种部队」,凭极致代码洁癖和作坊式灵感打出了硅谷侧目的战绩。但 从首轮融资到如今密集动作,DeepSeek 已演进成一家数百人规模的企业。融资后服务端扩容,再没长时间宕机——但那只是解决了浅层问题。

今天 DeepSeek 面对的不只是服务器压力。大模型正经历从「静态预训练」走向「动态环境交互」的深刻质变:过去训练是给模型塞静态文本;现在强化学习与 Agent 时代,模型必须在毫秒级内与成千上万个动态沙盒实时交互。教模型下棋,从「看千万盘死棋谱」变成「让模型同时在十万个动态棋盘前跟自己博弈」。

作坊式系统自己跑跑还行,扛不起这种级别的工业级动态负荷。以 V4.1 Flash 这种吞吐和推理速度,它需要极强的调度能力——批处理怎么排、长短请求怎么混排、流量突增时怎么秒级调资源、凌晨低谷怎么自动缩容。这些工程问题反而成了关键。

新结构同样意味着要自己改推理框架、写 CUDA 算子、做模型压缩和量化。V4.1 的 Agent 能力越强,需要的沙盒环境越多、弹性计算调度越复杂;多模态越成熟,数据管道和存储压力越大——这 150 名工程师的作用就在于此

150 人不过是大厂一个部门季度配额,但放在 DeepSeek 身上已是 翻倍量级的大动作。DeepSeek 已完成 0 到 1,现在梁文锋面对的是 1 如何到 100——V4.1 Flash 成了 DeepSeek 的成人礼

来源|字符AI,转载已获原作者授权(TeTsaiPrime),邮箱 149559268@qq.com


  • DeepSeek V4.1 Flash 中间版本 deepseek-v4.1-flash-expires-on-0910 开启内测,测试期到 9 月 10 日,官方称采用新结构、原生多模态、性能与成本均改善。
  • 实测「你好」一问,V4.1 Flash 思考 0.3 秒、生成 159.3 token/秒、端到端 0.8 秒;重度长文本推理达 420 token/秒、端到端 409.5 token/秒。
  • 同任务端到端对比 V4 Flash Vision-Exp:49k 上下文检索快 5.2 倍、SVG 快 6.0 倍、Manacher 快 4.6 倍、SQL 快 5.0 倍、asyncio 架构重构快 3.9 倍。
  • 价格与 V4 Flash 相同——这是梁文锋被重新尊为「梁圣」的核心原因:性能暴涨,调用成本不动。
  • 就在内测前一天,DeepSeek 宣布扩招 150 人 HC,方向覆盖服务端开发(大模型研究平台、Agent 框架、研发效率基建、DeepSeek API、线上服务、数据工程)与 Agent 弹性计算。
  • DeepSeek Harness 负责人崔添翼解释:量的激增引发复杂度指数级爆炸,原作坊式后端扛不住工业级动态负荷,必须升级、维护、重写。
  • 大模型从「静态预训练」走向「动态环境交互」:训练需毫秒级与成千上万沙盒实时交互——这是新结构 + 150 人 HC 的工程意义。
  • V4.1 Flash 是 DeepSeek 第一款原生多模态模型,区别于 V4 Flash Vision-Exp 的「外挂」式多模态——V4.1 出厂自带图文一体化输入输出。
  • V4 正式版到 V4.1 只用 40 天便采用新结构并降本,业内调侃「这难道不该叫 V5 Flash 吗」。
  • DeepSeek 已完成 0→1,正在用 150 人 HC 回答 1→100 的问题——V4.1 Flash 被外界视为 DeepSeek 的「成人礼」。
赞(0) 群聊
文章链接:https://www.tucaod.com/17119.html

讨论群终身200元

永远不解散,不涨价。不荐股、不带单。
ai学习安装,美股分析交流,不构成任何投资建议。终身免费指导。
AI产业链资料库

联系我们

觉得文章有用就可以进群

继续追寻中本聪的脚步

支付宝扫一扫打赏