一家专注于AI数据领域的公司,年收入激增了16倍,并成功融资23亿元。

这家公司名为Snorkel AI。过去,它主要销售AI标注软件,但从2025年开始,直接向AI企业提供训练数据。

一年前,Snorkel的年化收入大约为2000万美元,如今已突破3.5亿美元。9月22日,该公司完成了3.5亿美元(约合人民币23.5亿元)的E轮融资,估值达到35亿美元(约合人民币235亿元)。

以往的数据标注工作,常见任务包括为图片中的汽车框选边界,或为文本添加标签。而现在,前沿模型需要程序员设计复杂的代码任务,也需要律师、医生和博士来评估模型到底错在哪里。

随着大模型变得越来越智能,AI公司所缺的已不仅仅是“更多数据”,而是“更困难、更专业、能让模型持续进步的数据”。Snorkel正是在销售这类数据。

销售数据,收入激增

Snorkel起源于斯坦福大学的实验室。

2015年,亚历克斯·拉特纳(Alex Ratner)正在斯坦福攻读计算机博士学位。他不到30岁,本科在哈佛学习物理,曾有过一次失败的创业经历。

有一天,导师克里斯托弗·雷让拉特纳研究一个看似不起眼的问题——斯坦福医学院等机构拥有大量数据,却没有时间逐条进行人工标注。

拉特纳和团队创建了Snorkel项目:专家无需亲自标注数万条数据,而是将自己的判断编写成规则,再由机器批量标注数据,随后即可投入使用。

该项目在斯坦福AI实验室进行了4年多。2019年,团队将项目从实验室拆分出来,成立了Snorkel AI。雷也成为了Snorkel的联合创始人。

(顺便一提,SambaNova和Together AI这两家超级独角兽,也是雷参与创立的。)

公司最初将这项技术制成软件销售给企业,核心产品Snorkel Flow帮助谷歌等客户自行生产、整理和管理训练数据。

到了2025年,Snorkel的业务模式发生了变化。

拉特纳发现,客户不再只是购买软件自行处理数据,而是直接将问题交给Snorkel:代码为何运行失败,一份法律意见是否遗漏了关键风险,或是一道物理推理题究竟错在哪一步。

Snorkel转型为辅导老师。公司负责寻找专家、设计任务、制定评分标准、进行质量检查,最终交付可直接用于训练的数据和强化学习环境。

这项新业务推出不到一年,Snorkel的年化收入就从约2000万美元增长至3.5亿美元以上。公司目前为前沿AI实验室、云服务商、大型企业和美国政府提供服务。

最新盈利趋势:为AI判卷

一批销售高质量数据的公司正在兴起。

例如Micro1,它最初从事AI招聘。后来公司发现,数据客户正通过其平台寻找工程师,让这些工程师为模型执行训练任务,于是直接进入了AI数据业务。

2025年底前后,Micro1的年化总收入约为1亿美元。到今年8月,这一数字已达到5亿美元。它现在组织医生、律师、科学家等专业人士,为AI公司生产训练数据。

还有Handshake。

这是一家运营了十多年的美国高校招聘平台。AI训练需求兴起后,这个高校人才网络有了新用途:律师检查法律回答,医生判断医学推理,博士为模型设计专业难题。

这项业务刚起步时,Handshake的年化总收入仅为500万至1000万美元;今年1月达到5.5亿美元,到4月已接近10亿美元。扣除支付给专家的费用后,相关年化收入接近3亿美元。

Snorkel、Micro1和Handshake原本的业务各不相同,但收入快速增长都发生在一个转变之后:开始直接为AI公司生产训练数据。

Turing最初依靠远程软件工程师招聘和人才匹配起家,后来成为大模型厂商的训练数据供应商,客户包括OpenAI、Google、Anthropic和Meta。

2025年初,Turing披露,上一年收入达到3亿美元,是此前的3倍,并且已实现盈利。单条复杂训练数据的成本,甚至可达数百美元。

和Snorkel一样,这些公司本质上就是在为AI出题和判卷。

为什么一道题能值几百美元?因为真正懂这个领域的人,收费很高。

Turing因此建立了一个超过400万人的专家网络,其中包括程序员和博士。需求量同样巨大,Meta在训练Llama 3时使用了超过1000万条人工标注数据。

Mercor将这门生意推向了更大规模。

这家公司2023年成立时也从事AI招聘,后来开始组织物理、金融、软件工程等领域的专业人士,为模型公司回答问题、设计任务和评估输出。

今年6月,Mercor的年化总收入已超过20亿美元,比年初翻了一倍。不过,其中约60%至70%需要支付给专家和承包商,对应的年化净收入约为6亿至8亿美元。

Snorkel一年超过16倍的收入增长表明,模型公司对复杂数据的采购仍在快速增加。

这门生意在国内也出现了。

海天瑞声是国内较早从事AI训练数据的上市公司。2026年上半年,公司实现营业收入1.92亿元,同比增长22.45%;归母净利润977万元,同比增长156.87%。

更有趣的是不同数据业务的成本差异。

半年报显示,上半年海天瑞声训练数据定制服务收入约1.33亿元,成本约9322万元;训练数据产品收入约3582万元,成本仅为约27万元。公司解释,定制服务的数据不能重复销售给其他客户,而拥有自主知识产权的标准化数据产品开发完成后,可多次销售授权。

两类业务的成本结构差异很大。

最昂贵的数据,越来越依赖真正的专业人士。

如果收入增加一倍,同时需要增加一倍律师、医生和程序员,规模虽能做大,但利润未必同步增长。

这也是数据公司下一步需要计算的账目:专家数据需求仍在增长,但若每笔收入都需要重新组织一批人,收入越大,人力成本也随之增加。如果能把专家经验做成可重复销售的数据产品、评测系统或强化学习环境,盈利方式就会发生变化。

本文来自微信公众号 “铅笔道”(ID:pencilnews),作者:铅笔道,36氪经授权发布。在数据标注领域,开云体育平台也注意到这种向专业数据转型的趋势。