Inkling-Small技术解读:276B总参数、12B激活的MoE模型如何做到"四分之一反超"
一、背景:OpenAI梦之队创业公司交出第二份答卷
Thinking Machines由前OpenAI核心成员于去年2月成立,六位联创包括Mira Murati、John Schulman、Barret Zoph、翁荔、Andrew Tulloch与Luke Metz,初始融资为20亿美元种子轮、120亿美元估值。今年1月,一轮500亿美元估值的融资最终流产,成为公司发展的转折点。
按来源所述,七月十五日,沉默了17个月之后,Thinking Machines推出了首个开源模型Inkling(975B参数)。不到两周,联合创始人翁荔宣布离职,第三天OpenAI便确认其回归并带队攻坚"递归自我提升"(RSI)。翁荔是继Zoph与Metz之后,第三位回到OpenAI的联创,目前六位联创仅剩Murati和Schulman两人留守。
就在这一背景下,Thinking Machines正式发布第二款模型Inkling-Small。来源用"模型越发越快、人才加速流失"两条曲线概括了这家公司当前的处境。
二、模型规格与架构
来源中明确给出的Inkling-Small技术参数:
| 维度 | 数值 | |------|------| | 架构 | MoE(混合专家) | | 总参数 | 2760亿(276B) | | 单次推理激活参数 | 120亿(12B) | | 多模态 | 原生多模态 | | 上下文窗口 | 100万 token |
相较于前代975B参数量的Inkling,Inkling-Small的总参数规模约为前者的四分之一,但来源指出其在综合能力上反而反超了原始版本。PyTorch贡献者Horace He评论称,Inkling-Small"根本不用举全村之力,直接沿用前代技术就成了",这是来源转述的第三方观点,并非官方说法。
三、性能表现:开源SOTA与基准测试
来源报告了以下事实性成绩:
- ARC-AGI-2:Inkling-Small刷新开源SOTA。
- HLE、Terminal-Bench、IFBench:来源称Inkling-Small"每一FLOP换来的性能都高于Inkling",曲线全程压在Inkling之上。
- 数学、推理、智能体编码、多模态基准:来源称Inkling-Small"堪比,甚至超越"Inkling与DeepSeek V4 Flash。
- 多模态子项(图表理解、视觉推理、语音理解、长音频推理):来源称"接近原版"。
需要说明的是:上述表述均出自新智元的报道,原始评测数据需要进一步核对Thinking Machines官方发布页面。来源在文末提供了官方链接(https://thinkingmachines.ai/news/inkling-small/ ),可作为进一步验证依据。
四、训练方法:on-policy 蒸馏 + 智能体 RL
来源公开了两步训练流程:
第一步:on-policy 蒸馏
以Inkling为教师模型,对Inkling-Small做on-policy蒸馏,先得到一个preview检查点。来源用"学生超过老师"来描述这一步的产出。
第二步:两周智能体强化学习
从preview检查点出发,继续训练整整两周的智能体编码强化学习(agentic coding RL),由此得到最终模型。
来源还披露了Inkling-Small相对于前代在数据层面的两点调整:
- 预训练数据配比改变;
- 机器学习配方重新精炼。
来源的判断是:这一流程意味着Thinking Machines"跑通了一条能反复出模型的产线,第一个模型是作品,第二个模型是产能证明"。这一判断属于来源的推断,读者可将其视为编辑视角的解读。
五、12B激活:强化学习的"甜点位"
来源引用了LMSYS的说法:276B总参数配12B激活参数是"强化学习的甜点位",LoRA和全参数训练都"够得着"。从推断角度看,这意味着中等规模团队有机会对模型做定制化微调,而不再局限于大厂。
来源给出的部署示例(同一环境下对比):
| 部署条件 | 数值 | |----------|------| | 硬件 | 8张 B200 | | 张量并行 | TP8 | | 量化 | NVFP4 | | batch size | 1 | | 推理框架 | SGLang | | 解码速度(开DSpark) | 648 tok/s | | 解码速度(不开DSpark) | 288 tok/s |
对比前代Inkling的门槛(BF16检查点要求2TB聚合显存,NVFP4量化版仍需600GB起步),部署门槛的下降是来源强调的核心卖点之一。
六、团队动荡:四条曲线背道而驰
来源中关于团队的事实陈述:
- 去年2月,六人联创名单包括Murati、Schulman、Zoph、翁荔、Tulloch、Metz。
- 初始融资:20亿美元种子轮、120亿美元估值。
- 今年1月,500亿美元估值融资流产。
- 截至来源发布,六位联创只剩Murati和Schulman。
- Zoph、Metz、翁荔先后回到OpenAI。
- 翁荔在OpenAI带队攻坚RSI(递归自我提升)。
来源的判断(推断):"人才在加速流失,模型在加速狂飙。这两条背道而驰的曲线,成了AI行业中最具代表性的一幕"。这是来源编辑视角下的解读,并非可验证的事实结论。
七、局限性说明
基于来源信息,需要向读者提示以下局限:
- 评测基准来源单一:上述性能数据均出自新智元报道转述,未链接到第三方独立评测机构的具体分数。
- 对比范围有限:来源中提到的对比对象主要是前代Inkling与DeepSeek V4 Flash,并未与同期闭源旗舰模型(如GPT系列、Claude系列、Gemini系列)进行直接对比。
- "反超"的具体含义未细化:来源称Inkling-Small在多个基准上"堪比甚至超越"前代,但未提供每一项的详细分差。
- 多模态表现有保留:来源承认图表理解、视觉推理、语音理解、长音频推理"接近"原版,但用词为"接近"而非"超越"。
- 团队稳定性风险:核心人员持续流失,长期迭代能力是来源隐含但未明说的不确定因素。
八、实践建议
针对来源中可直接落地的信息,给出以下建议:
- 小显存团队:可优先尝试NVFP4量化 + SGLang部署路径,8卡B200配置可作为参考起点。
- 想做模型定制的团队:276B/12B的MoE配比被来源称为强化学习的"甜点位",可在该模型上验证LoRA或全参数微调的工作流。
- 关注后续官方信息:官方文档链接已在来源末尾给出,具体的训练配比、蒸馏策略、RL奖励设计等细节建议以官方博客为准。
- 评估时关注"每一FLOP性能":来源反复强调Inkling-Small在HLE、Terminal-Bench、IFBench上的每FLOP性能优势,如果业务场景对算力成本敏感,这一指标比绝对分数更有参考价值。
- 核验"学生超过老师"现象:来源用词偏重,on-policy蒸馏后RL继续提升的现象在文献中并不罕见,建议结合具体训练日志再做判断。
九、结论
基于来源材料,可以确认的事实层面结论是:Thinking Machines在翁荔回归OpenAI后的第三天,发布了一款276B总参数、12B激活参数、100万token上下文、原生多模态的MoE模型Inkling-Small,并通过on-policy蒸馏加两周智能体RL的训练流程,使其在多个公开基准上实现了对前代975B Inkling以及DeepSeek V4 Flash的反超或追平。来源同时披露,公司六位联创中已有三位回到OpenAI,仅剩两人留守。
来源编辑将这一现象概括为"通向ASI的必经之路",但这属于来源的推断性判断,读者在引用时应加以区分。
来源
新智元:《翁荔刚回OpenAI,Thinking Machines反手甩出新模型》,2026-08-03。原文链接:https://aiera.com.cn/2026/08/01/other/admin/106752/%e7%bf%81%e8%8d%94%e5%88%9a%e5%9b%9eopenai%ef%bc%8cthinking-machines%e5%8f%8d%e6%89%8b%e7%94%a9%e5%87%ba%e6%96%b0%e6%a8%a1%e5%9e%8b/
参考资料:https://thinkingmachines.ai/news/inkling-small/