「20亿,阿里领投一位90后实习生:给AI当老师」
一家成立不到一年的AI公司,正在拿下20亿元融资。据报道,阿里巴巴拟领投UniPat新一轮约3亿美元融资,腾讯、红杉中国等参与,公司估值约25亿美元,折合人民币近170亿元。UniPat给AI出题、判卷,告诉模型哪里做错了——这门生意已经开始赚大钱。
一年冒出三家十亿美元生意
不到一年,UniPat 就把 AI 出题、判卷做成了生意,还带出一批十亿美元级同行。
| 维度 | 核心结论 |
|---|---|
| 融资规模 | UniPat获阿里拟领投约3亿美元,估值25亿美元(近170亿元),成立不到一年即拿下20亿元级融资 |
| 赛道玩家 | Surge AI、Mercor、Scale AI、Handshake已跑出三家十亿美元级收入,AI数据与评测成新风口 |
| 评分标准即数据 | 模型越强越需要专业人判卷,评分标准本身成了数据,从”有没有答案”转向”什么答案才算好” |
| 能力壁垒 | UniPat ExpertEval覆盖3213个专家案例、207个场景;SaaS-Bench端到端完成率仅3.8% |
| 商业模式 | 从卖专家时间到RL Environment,形成三层收费,越往后越接近AI训练基础设施 |
| 公司 | 成立 / 切入 | 融资与估值 | 收入(口径) | 关键客户 / 备注 |
|---|---|---|---|---|
| UniPat | 2025年末成立(创始人李宽,90后) | 新一轮约3亿美元(阿里拟领投,腾讯、红杉中国等参与);估值约25亿美元(折人民币近170亿元) | 原文未披露(”已经开始赚大钱”) | 头部大厂AI智能体项目;为AI出题、判卷 |
| Surge AI | 创始人Edwin Chen(曾任职Google、Facebook、Twitter) | 原文未披露 | 2024年收入约12亿美元 | 客户:Google、Meta、Microsoft、Anthropic;高毛利数据服务商 |
| Mercor | 由AI招聘转向AI训练 | 原文未披露 | 2025年6月年化总收入超过20亿美元(较2月10亿美元翻倍);上半年总收入约6.14亿美元(91%来自基础模型公司) | 客户:OpenAI、Anthropic、Google DeepMind;约60%–70%流水付专家 |
| Handshake | 原大学生招聘平台,2025切入AI训练 | 原文未披露 | 切入不到一年年化总收入接近10亿美元;扣除专家报酬后年化净收入约3亿美元 | 企业真实运营数据合作:10万–400万美元以上/份 |
| Scale AI | 自动驾驶数据标注起家 | 2025年Meta斥资143亿美元取得49%股份,估值升至290亿美元 | 原文lead提”去年收入逼近10亿美元”(正文未详述) | 业务:高质量训练数据、模型评测、红队测试、政府项目 |
UniPat:90后博士的AI评测创业
UniPat成立于2025年末,创始人李宽是90后,本科毕业于北京航空航天大学,硕士毕业于中国科学院计算技术研究所,目前在香港科技大学计算机科学与工程系攻读博士,研究方向包括LLM Agent。创业前,他曾作为实习生在阿里通义DeepResearch参与后训练研究,重点包括数据合成和强化学习。后训练解决的核心问题之一,是让已经完成预训练的模型继续”变聪明”——训练团队不仅要知道模型会做多少题,更要知道什么答案算好、错在什么地方、哪种反馈最值得拿去继续训练。
UniPat把这件事做成了产品。一位在头部大厂AI智能体项目负责人告诉铅笔道,UniPat取代了智能体研发项目中原本测试团队要做的事,把整个评估过程打包成产品来评估AI任务执行的完善程度,切中了刚需。目前最直接的赚钱方式,是把专业人士的判断卖给大模型公司。
Mercor、Handshake、Surge:卖专家判断的同行
Mercor为OpenAI、Anthropic、Google DeepMind等组织程序员、律师、金融从业者和科学家,让他们出题、写答案、评价模型输出,再把数据交给客户做后训练。公司最初做AI招聘,后来发现最舍得为高端人才付钱的是大模型实验室,于是转向AI训练。据Forbes报道,Mercor今年6月的年化总收入超过20亿美元,比2月的10亿美元又翻了一倍;公司上半年总收入约6.14亿美元,其中约91%来自基础模型公司。但这20亿美元不是纯软件收入,约60%至70%的流水要付给专家,Mercor赚的是撮合差价,更重要的是快速找到合适专家、控制交付质量。
Handshake走的是同一条路。它原本是大学生招聘平台,2025年切入AI训练后,不到一年这项业务的年化总收入接近10亿美元,扣除专家报酬后年化净收入约3亿美元。Surge AI则更像一家高毛利的数据服务商,创始人Edwin Chen曾在Google、Facebook和Twitter工作,2024年收入约12亿美元,客户包括Google、Meta、Microsoft和Anthropic。Surge卖的同样是人类反馈和高质量数据,但它把业务往更高价值环节推:不只是找人做题,而是设计任务、评分标准、评测集和训练环境,相比单纯人力撮合更接近一套AI后训练服务。这几家公司赚的是同一笔钱:模型越强,越需要更专业的人告诉它哪里错了。
ai训练数据标准
行业之所以从标注走向评测,原因很简单:模型已经越来越会考试。早期训练数据的问题是”有没有答案”,今天的问题变成了”什么答案才算真正好”。让AI识别一只猫,可以用一个标签解决;让AI修改一个大型代码仓库、做一份投行分析、完成医院行政流程,很难只用”对/错”两个字评分。这时,评分标准本身就成了数据。
UniPat 的三套评测集
UniPat今年推出的ExpertEval覆盖医疗、金融和法律三个领域,共3213个专家案例、207个场景,每个案例平均设置21.83条评分标准。它不仅看结论,还检查证据、推理过程和高风险错误,这些评分结果可以继续用于后训练。它的Monthly-SWEBench则每月从最新关闭的GitHub任务中抽题测试模型,题库必须不断更新,因为公开Benchmark很快会被”刷题”:分数上涨,不等于真实工作能力同步提高。它的SaaS-Bench更接近真实工作,把Agent放进23套可运行的SaaS系统,要求完成报销、关账、项目管理、医疗行政等任务。
这3.8%恰恰是这类公司的生意。目前最好的模型虽然能完成不少中间步骤,但端到端完全完成任务的比例只有3.8%。如果Agent已经能稳定完成99%的工作,评测公司的价值反而会下降;正因为模型频繁失败,AI实验室才需要不断找新题、找错误、设计评分规则,再把失败样本送回训练,模型每升级一次这个循环就可能重来。Scale AI也经历了类似升级,它从自动驾驶数据标注起家,后来进入高质量训练数据、模型评测、红队测试和政府项目;2025年,Meta斥资143亿美元取得其49%股份,公司估值升至290亿美元。这类公司的价值是能否持续发现模型不会做的事,再把失败原因变成训练信号,模型每升级一次,新的评测和训练需求就会再来一遍。
RL Environment:评测公司的下一门生意
RL Environment:给Agent搭模拟公司
行业正在寻找比”按人头卖数据”更好的商业模式,新的方向叫RL Environment,也就是强化学习环境。可以把它理解成给Agent搭一间”模拟公司”,里面有邮件、CRM、代码库、财务系统、客户工单和各种工具,AI不只是回答一道题,而要连续完成几十甚至几百步操作,系统再根据结果自动打分,让模型反复练习。这比传统标注更难,也更接近软件产品——传统模式需要不断招人、派单、验收,收入增长往往伴随人工成本增长;训练环境一旦搭好,可以被不同模型反复调用,并持续生成新的训练轨迹和反馈信号。
Surge已经成立专门团队建设这类环境,今年发布的EnterpriseBench CoreCraft模拟了一家客户支持公司,包含2500多个实体、23种工具,让Agent处理多步骤工作。Mercor也在7月收购了专门做强化学习环境的Deeptune,并明确把编码、医疗、法律等领域的训练环境作为下一阶段业务。Handshake则开始把另一种稀缺资源拿出来卖:企业真实运营数据,它公开向企业征集经过脱敏的业务数据,根据数据规模和价值,一份合作可支付10万至400万美元以上,再把整理后的数据提供给前沿AI实验室用于训练和评测。
三层收费,越接近基础设施
这说明这门生意正在形成三层收费:第一层卖专家时间,第二层卖整理好的训练数据和评分标准,第三层卖可以持续产生训练数据的环境。越往后,越接近基础设施。当然,这门生意还没有摆脱人力服务,Mercor约六至七成流水需要付给专家,客户又高度集中在少数头部AI实验室;Scale在Meta入股后遭遇部分客户关系变化,也说明“中立第三方”本身就是一种资产。
- 不是芯片也不是算力,而是一群给AI出题、判卷的公司在赚钱:UniPat估值约25亿美元,阿里巴巴拟领投,腾讯、红杉中国等参与,成立不到一年即拿下20亿元融资。
- 一家成立不到一年的AI公司正在拿下20亿元融资。UniPat做的是AI后训练里最关键的一环,告诉模型错在哪里、什么答案才算真正好,大股东为阿里巴巴。
- 2024年Surge AI收入约12亿美元,Mercor年化总收入超20亿美元,Scale AI去年逼近10亿美元,AI数据与评测已跑出三家十亿美元级生意。
- UniPat创始人李宽是90后,北航本科、中科院硕士、港科大博士,曾在阿里通义DeepResearch参与后训练研究,研究方向包括LLM Agent与强化学习。
- 从标注到评测,行业逻辑变了:早期数据问的是有没有答案,现在问的是什么答案才算真正好,评分标准本身就成了可训练的数据。
- UniPat的ExpertEval覆盖医疗、金融和法律三领域,共3213个专家案例、207个场景,每个案例平均设置21.83条评分标准,还可查推理过程。
- SaaS-Bench把Agent放进23套可运行SaaS系统,结果目前最好的模型端到端完全完成任务的比例只有3.8%,这正是评测公司的生意空间。
- 下一个方向是RL Environment,也就是强化学习环境:给Agent搭一间模拟公司,让模型连续完成几十上百步操作并自动打分,反复练习。
- 这门生意正在形成三层收费:卖专家时间、卖整理好的训练数据和评分标准、卖能持续产生训练数据的环境,越往后越接近基础设施。
- 但人力服务仍未摆脱:Mercor约六至七成流水要付给专家,客户高度集中于头部AI实验室,中立第三方本身就是一种稀缺资产。
原文链接:20亿,阿里领投一位90后实习生:给AI当老师(来源:铅笔道)
作者 | 铅笔道 松格;编辑 | 铅笔道 黄小贵






