一、从一次人事变动和一次模型发布说起
最近一段时间,AI 行业接连发生两件引人关注的事:一位在大型科技公司效力 27 年的资深研究员宣布离开,并携三位长期合作者创办了一家新公司,明确将「递归自我改进」(Recursive Self-Improvement,下文简称 RSI)作为核心方向;几乎同一时间,一支由高校与产业机构联合组成的团队发布了一款 35B 参数的基座大模型 BigBang-V1,采用他们称为「原生 RSI」的合成数据训练方式,在多项高难度科学基准上取得了领先成绩。
把两件事放在同一坐标系里看,会发现它们指向同一条判断:AI 行业正把越来越多的注意力,从「如何把模型做得更大」转向「如何让训练任务和训练数据本身不断进化」。这正是本文要展开讨论的主线——什么是数据层的 RSI,它在 BigBang-V1 中是如何被工程化落地的,它带来了哪些可见的效果,又存在哪些尚未解决的边界。
二、什么是「数据层的递归自我改进」
1. RSI 不是一个新概念,但要把它落到训练数据上并不容易
递归自我改进的原始设想可以追溯到对自指学习系统的理论讨论,核心想法是:让一个 AI 系统在迭代中不断提升自己——既包括提升模型本身,也包括提升它用于训练自己的任务和数据。AlphaGo Zero / AlphaZero 把人类棋谱完全丢掉,让模型通过自我博弈不断变强,被视为这一思想在策略搜索领域的成功范本。
但把同样的思路搬到「通用大模型训练」上,难度陡增。原因在于:下棋有清晰的胜负规则、状态空间有限,而人类知识和科学问题没有现成的胜负函数,状态空间近乎无限。这要求系统不只是在「解」上自我博弈,还要在「题」和「判」上自我博弈——由 AI 自己出题、自己判题,再用真实训练结果来反向校准出题人和判卷人。
2. BigBang-V1 的做法:把合成数据做成一条会自我修正的流水线
BigBang-V1 的训练方式可以拆成三层来理解:
第一层:Generator Agent,负责出题。它会直接修改、运行、调试数据合成程序,根据模型当前的能力缺口动态调整:题目该从哪些学科来、推理链要多长、用搜索/计算/代码/模拟中的哪些工具、最终答案怎么验证、哪些样本保留、哪些策略已经证明失败。每跑一轮,它会把「改了什么—为什么改—结果如何—哪里失败」记录下来,下一轮从这些经验出发继续探索。
第二层:Critic Agent,负责审题。它的审查分两层:先看格式、工具执行、数据完整性等硬伤;再看题目本身是否正确、是否可验证、难度是否合适、是否与已有样本重复,以及「训了到底有没有用」。不达标的打回重造,合格的进入合成数据集。
第三层:用真实训练结果考核判卷人。如果 Critic 给高分、但模型在这些题上并没有变强,说明 Critic 的判分偏离了真实收益。系统会把真实训练信号回灌,重新校准 Critic 的判分权重,并相应地调整 Generator 下一轮的选题和难度。
这样,整套系统形成一条闭环飞轮:真实任务暴露能力缺口 → AI 造题并筛题 → 用合成数据训练新模型 → 模型回到真实任务受检 → 用结果校准下一轮造题与判题。
需要特别指出的是,这一整套合成数据在 BigBang-V1 的训练中被描述为「100% 由 AI 合成」,但「数据由 AI 生成」并不等于「没有人类设定的目标函数」——领域选择、验证方式、可计算工具的接口,都仍然由研究团队定义。这是理解「原生 RSI」时容易被忽略的一点。
三、为什么把「科学」作为训练场
RSI 的成立需要两个条件同时满足:题目要位于能力边界(前沿),并且答案要可被客观检验(可验证)。
科学天然同时满足这两条:前沿科学问题难到位于知识边界,许多根本没有已知最优解,且新理论、新工具会不断制造新题,不会像静态题库那样被刷完;同时,形式化方法、代码执行、数值计算、仿真器、实验反馈、领域专用工具等,都能为科学问题提供可验证的答案通道。
更进一步,科学把搜索、阅读、提假设、数学推导、写代码、调工具全揉进一道题里,相当于一门「通往通用智能的综合课」。这是这支团队把科学选作 RSI 训练场的核心理由,也是为什么他们把模型命名为「无尽前沿」。
四、BigBang-V1 展示了哪些可见的效果
按公布数据,BigBang-V1(35B)在多个由第三方机构提出的高难度基准上取得了领先:
- 在 OpenAI 提出的 FrontierScience Research 上得分 46.2,在被对比的对象中处于领先位置;
- 在 Humanity's Last Exam(人类最后考试)上得分 50.3,接近某大型闭源模型在该基准上的水平;
- 在 PaperBench(Code-Dev,复现 AI 学术论文能力)上得分 53.6;
- 在 MLE-Bench (Lite)(自主完成 AI 工程能力)上得分 59.1;
- 在 BioMysteryBench Human-Difficult 上得分 15.7,该基准考察从含噪声的测序数据中分析生物学结论的能力。
在这些分数之外,更值得注意的是任务过程中的行为:
- 在某道病毒判定题上,BigBang-V1 三次给出完全一致的正确答案;
- 在一篇需要复现的论文中,它读到一半发现原文核心设定存在矛盾——一个关键量被固定,导致论文声称的「子集不断缩小」根本不会发生——于是主动修改该设计并修复一处梯度中断问题,最终得分 0.7657;
- 在抗体设计任务中,它把多个开源模型串联成一条流水线(蛋白质设计模型生成候选 → AlphaFold 预测复合物结构 → 物理打分器评估界面能量与原子冲突),用两套独立计算方法交叉验证候选。
这些表现说明:在 RSI 训练范式下,模型不仅在分数上接近更大体量的对照对象,而且在「发现错误—调整设定—调用多种工具—形成完整证据链」这种长程能力上呈现出可观察的变化。
五、这条路线的影响:可能改变什么
1. 训练范式的重心可能从「参数扩展」向「任务与数据扩展」迁移
如果一个 35B 模型通过改进训练任务的生成方式,能在多个高难度科学基准上接近或超过体量大得多的闭源模型,那么「Scaling」的下一步就不必然指向参数与算力的堆叠,而可能指向「训练任务的智能化生成」。这是一条与单纯扩大模型规模并行、但逻辑独立的方向。
2. 科学发现与模型训练有望形成正反馈
「AI 推进科学,科学反哺 AI」这条闭环一旦稳定运转,意味着每一轮 AI 能力的提升都会为下一轮制造更好的训练素材和更难的训练任务,模型的进步速度不再被人类生产训练数据的速率天花板卡住。
3. 评估方式需要随之升级
当训练数据本身由 AI 生成、且生成策略不断自我修正时,传统静态题库将越来越难以区分「真正的能力提升」与「对特定题型的过拟合」。这要求评估体系更偏向真实、长程、可验证的任务。
六、当前的边界与未解的问题
在公开信息层面,这套路线至少还存在几个尚未充分验证的边界:
- 合成数据的质量上限仍取决于 Critic 的判分质量。 即便加入了「用真实训练结果校准 Critic」的环节,Critic 的偏差只能被逐步压缩,难以被消除。出题人对判卷人的「讨好」现象(即堆砌表面难度、刷验证器漏洞)在理论上仍然可能发生。
- 「数据 100% 由 AI 合成」不等同于「没有人类先验」。 学科领域、可验证工具、目标函数仍然由人类设定。这意味着,RSI 的能力边界其实是被人类定义的可验证工具集决定的。
- 长程工具调用与代码修复的可复现性。 公布的案例展示了模型能发现问题并改设计,但这种能力在更广泛的任务类型上是否稳定,仍需要更多独立复现和第三方测评。
- 算力与训练的边际成本。 RSI 闭环本身需要在每一轮迭代中重新训练模型并采集训练结果,其计算开销并不天然低于传统数据生产方式,相关成本结构尚未在公开材料中详细披露。
- 科学结论到工程落地之间的距离。 在抗体设计等案例中,模型最终给出的是「通过两道独立计算验证的候选」,距真正可用的抗体仍需湿实验验证。这一点在公开材料中也有明确说明。
七、实践建议:如何看待类似成果
- 看分数时同时看过程。 高基准分只是入口;判断一个模型是否真正具备 RSI 红利,应关注它在任务过程中是否表现出「发现问题—调用工具—修正方案—形成证据链」的长程能力。
- 区分「路线」与「结果」。 RSI 是一条训练范式路线,BigBang-V1 是这条路线上的一个具体落点。路线是否可被不同团队、不同规模复现,比单一模型的分数更具参考价值。
- 关注评估方式的独立性。 当训练数据由模型自身生成时,第三方独立基准和真实任务的检验就变得更加重要,否则难以分辨能力提升与过拟合。
- 对「取代人类生产数据」保持理性。 即便在 100% AI 合成数据的设定下,目标函数、可验证工具、领域选择仍由人类设计,RSI 改变的是「数据生产的自动化程度」,而非「人类在 AI 训练中的角色」本身。
八、结语
从行业人事变动到 BigBang-V1 的发布,串起来看,AI 行业正把越来越多的资源押注在同一个命题上:让 AI 参与到 AI 自己的训练循环中。BigBang-V1 给出了一个具体的工程范本——以科学任务为牵引,由 Generator Agent 出题、Critic Agent 判题,再用真实训练结果反向校准整条流水线。
这条路线并不是要否定参数与算力的扩展,而是与之并行地打开了另一条扩展维度:当训练任务和训练数据能够自我进化时,模型进步的速度就不再被人类出题速率所限制。这是一条刚刚开始爬坡的曲线,但它已经给出了第一个可被检验的坐标点。