I

Ineffable Intelligence

AlphaGo之父David Silver × 纯强化学习替代人类数据 × 种子轮$11亿创纪录

AI圈 纯RL 无人类数据 种子轮$11亿

人物与背景

创始人David Silver
前职位Google DeepMind联合创始人、AlphaGo核心创造者
成就强化学习领域最高荣誉研究者
公司Ineffable Intelligence(英国)
种子轮$11亿(创历史纪录)
估值$51亿
投资方Sequoia、Lightspeed、NVIDIA、Google

商业模式拆解

核心主张:当前主流AI训练依赖海量人类标注数据——成本高、有偏见、有上限。Ineffable要用纯强化学习(RL)+ 自我对弈来替代,让AI像AlphaGo下围棋一样,不需要人类棋谱就能超越人类。

重新定价了什么?训练数据的成本。如果RL能替代人类反馈,训练前沿模型的边际成本将大幅下降。这对整个AI行业的经济学有颠覆性影响——目前数据标注是AI训练的最大成本之一。
为什么$11亿种子轮?因为David Silver是AlphaGo的创造者,他证明了RL可以在围棋这个"不可能赢人类"的领域击败世界冠军。投资人赌的是:如果这个方法能泛化到通用智能,那就是AI训练的范式转移。

锁定逻辑:如果成功,Ineffable的模型训练成本将远低于竞争对手(不需要数据标注团队),形成成本优势的护城河。同时,NVIDIA和Google同时投资,意味着它们可能在为未来的算力/云平台生态锁定技术路线。

四筛验证

重新定价了什么?
AI训练数据。从"花钱请人标注"到"让AI自己跟自己玩",边际成本趋近于零。
交易成本降了多少?
理论上可以把数据成本从数亿美元降到接近零。但目前尚未证明在语言、视觉等领域同样有效。
谁被锁定?
如果技术路线成功,所有依赖人类数据的AI公司都会被"降维打击"。但目前这还是一个假设。
最小验证单元?
先在一个可控领域(如代码生成、数学推理)证明纯RL可以超越有监督方法,再扩展到通用智能。

可迁移性思考

结构抽象:"消除最大成本项"——找到行业里最贵的那个环节,用技术把它砍到接近零。

金融圈映射:在资管行业,最大的成本项是什么?是研究团队的人力成本(分析师、基金经理的时间)。如果AI能替代80%的研究工作,那资管公司的成本结构会被彻底重塑。

更深层的启示:David Silver从DeepMind出走,不是因为技术不行,而是大公司的节奏跟不上一流研究者的直觉。当技术路线存在分歧时,赌对方向的人会出走自己干。这在金融圈也一样——当一个基金经理觉得公司的风控框架限制了他的策略时,他就会出来自己发产品。