看得见的配方,买不起的灶台:英伟达IMO开源背后的算力逻辑

一、这次开源的,不只是一个模型

9月9日,英伟达公布了Nemotron 3 Ultra在2026年国际数学奥林匹克(IMO)上使用的整套系统。它拿到30/42分,超过当届29分的金牌线,全程只用自然语言写证明——不用形式化证明器、不调外部工具、不联网

更有意思的是放出来的东西:两个数学专家checkpoint、SFT与强化学习训练数据、推理代码、训练配方、比赛提交证明原文,以及200道题的新基准Nemotron-IMO-Bench。也就是说,公开的不是“一个更强的数学模型”,而是一条从训练到赛场推理的完整链路。两天后,陶哲轩等25位菲尔兹奖得主联名批评AI数学成果发布过快、复现与核查跟不上——在这个背景下,把模型、数据、流程和算力账本一起留下,确实少见。

二、技术内核:让有限算力覆盖更多证明路线

这套系统的起点很克制:不再对同一个基座反复采样,而是先造出行为不同的专家。通用版、SFT版、RL版三份checkpoint形成三种解题偏好。原因很朴素:同一个模型生成200份答案,往往围着少数几种构造打转,200份文本不等于200条独立路线;候选相关性越高,新增计算带来的新信息越少。实验数据也印证了这一点——给单个RL模型把采样加到256次只接受14题,换成RL与SFT各128次的混合池,接受题数涨到18。换模型比堆采样更值钱。

SFT让“写了一半的证明”能被接着改,RL则把能闭环的思路权重抬高、把死路压低。两者合起来,解决的是有限推理预算如何尽可能多地覆盖证明空间

在此基础上,搜索才真正开始。首轮每题384份尝试(每个checkpoint从8个互补提示词各采样16次),结果被丢进一个持续更新的证明池:通过的放行,方向可用但有漏洞的留下并带回批评意见继续修,价值过低的才淘汰。多轮改写不是润色,而是每一轮重新产生候选、在全局池里重新竞争,资源跟着评价走。这跟围棋搜索不同——自然语言证明没有低成本的合法性判定,verifier不只是打分器,更是计算资源的调度者,它的误差会直接改写后续搜索路径。

这也暴露出当前路线最硬的瓶颈:生成端可以靠更多proposal、更大搜索池、更深修改链持续扩展,验证端却没有同样稳定的scaling路线。同一类模型反复检查,收益很快进入平台期;更可行的方向是让不同验证组件的错误来源尽量不重合——交叉检查、反例生成器、符号核验、局部命题交形式化证明器,组合起来降低“同时失效”的概率。赛后复盘里有个警示:截止时刻两套模型验证器集体估出约32分,比官方评分高2分,差额全来自P3和P6——那是模型评审的共性盲区,不是某家的噪声。

三、算力账本:配方免费,灶台收费

账本写得明明白白:六个提交证明约耗7.07亿token、1464个GB200 GPU小时,把在途轮次跑满总计约23.1亿token、4800 GPU小时。四个满分证明在开赛后76分钟内全部通过终选面板。

于是出现了那个刺眼的对照:权重可以下载,代码可以运行,但8张B200级别的显存墙和上千小时的长考成本,是一道把全球绝大多数高校实验室挡在外面的硬墙。 外部团队当然可以调checkpoint组合、sampling budget、verifier阈值和refinement深度,观察成绩怎么变——但这跟完整重跑30分是两回事。更何况Nemotron 3 Ultra通用版的完整后训练链并未逐阶段复刻,官方文档也写明部分中间teacher和MOPD checkpoint尚未开放。

所以这次开源的实际结构是:知识门槛被拆掉,资本门槛被保留。 你拿到了全部图纸,却发现自己唯一能做的事,是去买更多的卡。

四、“推恩令”式的阳谋

推恩令的高明之处,在于用利益共享消解对抗意志。今天这一幕高度相似:开源让全世界都能分享IMO金牌的方法论红利,同时也让所有人不知不觉进入了由英伟达硬件定义的搜索推理范式——proof pool、test-time scaling、生成—验证—精炼迭代,一旦成为研究默认语法,后续每一次能力跃升都会自然转化为对更大显存、更多GPU小时的需求。

这不意味着数学家的退场,而是角色的位移:从“寻找证据的人”变成“审判逻辑的人”。巨头烧掉数百万美元电费,把枯燥、重复、海量的逻辑可能性铲平;关于真理的最终裁决、关于验证逻辑的一致性,依然要仰仗人类直觉。这份报告对基础研究最大的尊重,或许不在那30分,而在它坦承了这一分工。

五、给后来者的三点现实判断

第一,别把“开源”读成“可及”。评估一个开源成果,要看三样东西:能不能下载、能不能跑通、能不能在自己预算内复现。三者之间隔着巨大的距离。

第二,最有复用价值的不是分数,而是消融数字和算力账。哪一步值得投钱、哪一步只是堆量,论文里都有对照。这对做推理系统的团队,比金牌本身有用得多。

第三,真正的竞争点正在从生成转向验证。谁能降低verifier与generator的错误相关性,谁就能让test-time compute继续有效扩展;在这之前,单纯扩大搜索池只会越来越贵、越来越钝。

代码平权已经实现,算力主权仍集中在少数人手里。这是未来AI for Science竞赛的一次预演:当方法变成公共品,稀缺的就只剩下电和芯片。