AI 自己出题自己做:BigBang-V1 与「数据层递归自我改进」意味着什么

AI 前沿AI 自己出题自己openstarry.com

一、从一次人事变动和一次模型发布说起

最近一段时间,AI 行业接连发生两件引人关注的事:一位在大型科技公司效力 27 年的资深研究员宣布离开,并携三位长期合作者创办了一家新公司,明确将「递归自我改进」(Recursive Self-Improvement,下文简称 RSI)作为核心方向;几乎同一时间,一支由高校与产业机构联合组成的团队发布了一款 35B 参数的基座大模型 BigBang-V1,采用他们称为「原生 RSI」的合成数据训练方式,在多项高难度科学基准上取得了领先成绩。

把两件事放在同一坐标系里看,会发现它们指向同一条判断:AI 行业正把越来越多的注意力,从「如何把模型做得更大」转向「如何让训练任务和训练数据本身不断进化」。这正是本文要展开讨论的主线——什么是数据层的 RSI,它在 BigBang-V1 中是如何被工程化落地的,它带来了哪些可见的效果,又存在哪些尚未解决的边界。

二、什么是「数据层的递归自我改进」

1. RSI 不是一个新概念,但要把它落到训练数据上并不容易

递归自我改进的原始设想可以追溯到对自指学习系统的理论讨论,核心想法是:让一个 AI 系统在迭代中不断提升自己——既包括提升模型本身,也包括提升它用于训练自己的任务和数据。AlphaGo Zero / AlphaZero 把人类棋谱完全丢掉,让模型通过自我博弈不断变强,被视为这一思想在策略搜索领域的成功范本。

但把同样的思路搬到「通用大模型训练」上,难度陡增。原因在于:下棋有清晰的胜负规则、状态空间有限,而人类知识和科学问题没有现成的胜负函数,状态空间近乎无限。这要求系统不只是在「解」上自我博弈,还要在「题」和「判」上自我博弈——由 AI 自己出题、自己判题,再用真实训练结果来反向校准出题人和判卷人。

2. BigBang-V1 的做法:把合成数据做成一条会自我修正的流水线

BigBang-V1 的训练方式可以拆成三层来理解:

第一层:Generator Agent,负责出题。它会直接修改、运行、调试数据合成程序,根据模型当前的能力缺口动态调整:题目该从哪些学科来、推理链要多长、用搜索/计算/代码/模拟中的哪些工具、最终答案怎么验证、哪些样本保留、哪些策略已经证明失败。每跑一轮,它会把「改了什么—为什么改—结果如何—哪里失败」记录下来,下一轮从这些经验出发继续探索。

第二层:Critic Agent,负责审题。它的审查分两层:先看格式、工具执行、数据完整性等硬伤;再看题目本身是否正确、是否可验证、难度是否合适、是否与已有样本重复,以及「训了到底有没有用」。不达标的打回重造,合格的进入合成数据集。

第三层:用真实训练结果考核判卷人。如果 Critic 给高分、但模型在这些题上并没有变强,说明 Critic 的判分偏离了真实收益。系统会把真实训练信号回灌,重新校准 Critic 的判分权重,并相应地调整 Generator 下一轮的选题和难度。

这样,整套系统形成一条闭环飞轮:真实任务暴露能力缺口 → AI 造题并筛题 → 用合成数据训练新模型 → 模型回到真实任务受检 → 用结果校准下一轮造题与判题。

需要特别指出的是,这一整套合成数据在 BigBang-V1 的训练中被描述为「100% 由 AI 合成」,但「数据由 AI 生成」并不等于「没有人类设定的目标函数」——领域选择、验证方式、可计算工具的接口,都仍然由研究团队定义。这是理解「原生 RSI」时容易被忽略的一点。

三、为什么把「科学」作为训练场

RSI 的成立需要两个条件同时满足:题目要位于能力边界(前沿),并且答案要可被客观检验(可验证)。

科学天然同时满足这两条:前沿科学问题难到位于知识边界,许多根本没有已知最优解,且新理论、新工具会不断制造新题,不会像静态题库那样被刷完;同时,形式化方法、代码执行、数值计算、仿真器、实验反馈、领域专用工具等,都能为科学问题提供可验证的答案通道。

更进一步,科学把搜索、阅读、提假设、数学推导、写代码、调工具全揉进一道题里,相当于一门「通往通用智能的综合课」。这是这支团队把科学选作 RSI 训练场的核心理由,也是为什么他们把模型命名为「无尽前沿」。

四、BigBang-V1 展示了哪些可见的效果

按公布数据,BigBang-V1(35B)在多个由第三方机构提出的高难度基准上取得了领先:

在这些分数之外,更值得注意的是任务过程中的行为:

这些表现说明:在 RSI 训练范式下,模型不仅在分数上接近更大体量的对照对象,而且在「发现错误—调整设定—调用多种工具—形成完整证据链」这种长程能力上呈现出可观察的变化。

五、这条路线的影响:可能改变什么

1. 训练范式的重心可能从「参数扩展」向「任务与数据扩展」迁移

如果一个 35B 模型通过改进训练任务的生成方式,能在多个高难度科学基准上接近或超过体量大得多的闭源模型,那么「Scaling」的下一步就不必然指向参数与算力的堆叠,而可能指向「训练任务的智能化生成」。这是一条与单纯扩大模型规模并行、但逻辑独立的方向。

2. 科学发现与模型训练有望形成正反馈

「AI 推进科学,科学反哺 AI」这条闭环一旦稳定运转,意味着每一轮 AI 能力的提升都会为下一轮制造更好的训练素材和更难的训练任务,模型的进步速度不再被人类生产训练数据的速率天花板卡住。

3. 评估方式需要随之升级

当训练数据本身由 AI 生成、且生成策略不断自我修正时,传统静态题库将越来越难以区分「真正的能力提升」与「对特定题型的过拟合」。这要求评估体系更偏向真实、长程、可验证的任务。

六、当前的边界与未解的问题

在公开信息层面,这套路线至少还存在几个尚未充分验证的边界:

七、实践建议:如何看待类似成果

  1. 看分数时同时看过程。 高基准分只是入口;判断一个模型是否真正具备 RSI 红利,应关注它在任务过程中是否表现出「发现问题—调用工具—修正方案—形成证据链」的长程能力。
  2. 区分「路线」与「结果」。 RSI 是一条训练范式路线,BigBang-V1 是这条路线上的一个具体落点。路线是否可被不同团队、不同规模复现,比单一模型的分数更具参考价值。
  3. 关注评估方式的独立性。 当训练数据由模型自身生成时,第三方独立基准和真实任务的检验就变得更加重要,否则难以分辨能力提升与过拟合。
  4. 对「取代人类生产数据」保持理性。 即便在 100% AI 合成数据的设定下,目标函数、可验证工具、领域选择仍由人类设计,RSI 改变的是「数据生产的自动化程度」,而非「人类在 AI 训练中的角色」本身。

八、结语

从行业人事变动到 BigBang-V1 的发布,串起来看,AI 行业正把越来越多的资源押注在同一个命题上:让 AI 参与到 AI 自己的训练循环中。BigBang-V1 给出了一个具体的工程范本——以科学任务为牵引,由 Generator Agent 出题、Critic Agent 判题,再用真实训练结果反向校准整条流水线。

这条路线并不是要否定参数与算力的扩展,而是与之并行地打开了另一条扩展维度:当训练任务和训练数据能够自我进化时,模型进步的速度就不再被人类出题速率所限制。这是一条刚刚开始爬坡的曲线,但它已经给出了第一个可被检验的坐标点。

以 AI 之力,筑未来之境

现在注册,立即免费获赠 200 次大模型调用权益

免费注册 →