Inkling-Small技术解读:276B参数、12B激活的MoE模型如何做到四分之一体量反超

AI 前沿Inkling-Small技术解读openstarry.com

Inkling-Small技术解读:276B总参数、12B激活的MoE模型如何做到"四分之一反超"

一、背景:OpenAI梦之队创业公司交出第二份答卷

Thinking Machines由前OpenAI核心成员于去年2月成立,六位联创包括Mira Murati、John Schulman、Barret Zoph、翁荔、Andrew Tulloch与Luke Metz,初始融资为20亿美元种子轮、120亿美元估值。今年1月,一轮500亿美元估值的融资最终流产,成为公司发展的转折点。

按来源所述,七月十五日,沉默了17个月之后,Thinking Machines推出了首个开源模型Inkling(975B参数)。不到两周,联合创始人翁荔宣布离职,第三天OpenAI便确认其回归并带队攻坚"递归自我提升"(RSI)。翁荔是继Zoph与Metz之后,第三位回到OpenAI的联创,目前六位联创仅剩Murati和Schulman两人留守。

就在这一背景下,Thinking Machines正式发布第二款模型Inkling-Small。来源用"模型越发越快、人才加速流失"两条曲线概括了这家公司当前的处境。


二、模型规格与架构

来源中明确给出的Inkling-Small技术参数:

| 维度 | 数值 | |------|------| | 架构 | MoE(混合专家) | | 总参数 | 2760亿(276B) | | 单次推理激活参数 | 120亿(12B) | | 多模态 | 原生多模态 | | 上下文窗口 | 100万 token |

相较于前代975B参数量的Inkling,Inkling-Small的总参数规模约为前者的四分之一,但来源指出其在综合能力上反而反超了原始版本。PyTorch贡献者Horace He评论称,Inkling-Small"根本不用举全村之力,直接沿用前代技术就成了",这是来源转述的第三方观点,并非官方说法。


三、性能表现:开源SOTA与基准测试

来源报告了以下事实性成绩:

需要说明的是:上述表述均出自新智元的报道,原始评测数据需要进一步核对Thinking Machines官方发布页面。来源在文末提供了官方链接(https://thinkingmachines.ai/news/inkling-small/ ),可作为进一步验证依据。


四、训练方法:on-policy 蒸馏 + 智能体 RL

来源公开了两步训练流程:

第一步:on-policy 蒸馏

以Inkling为教师模型,对Inkling-Small做on-policy蒸馏,先得到一个preview检查点。来源用"学生超过老师"来描述这一步的产出。

第二步:两周智能体强化学习

从preview检查点出发,继续训练整整两周的智能体编码强化学习(agentic coding RL),由此得到最终模型。

来源还披露了Inkling-Small相对于前代在数据层面的两点调整:

来源的判断是:这一流程意味着Thinking Machines"跑通了一条能反复出模型的产线,第一个模型是作品,第二个模型是产能证明"。这一判断属于来源的推断,读者可将其视为编辑视角的解读。


五、12B激活:强化学习的"甜点位"

来源引用了LMSYS的说法:276B总参数配12B激活参数是"强化学习的甜点位",LoRA和全参数训练都"够得着"。从推断角度看,这意味着中等规模团队有机会对模型做定制化微调,而不再局限于大厂。

来源给出的部署示例(同一环境下对比):

| 部署条件 | 数值 | |----------|------| | 硬件 | 8张 B200 | | 张量并行 | TP8 | | 量化 | NVFP4 | | batch size | 1 | | 推理框架 | SGLang | | 解码速度(开DSpark) | 648 tok/s | | 解码速度(不开DSpark) | 288 tok/s |

对比前代Inkling的门槛(BF16检查点要求2TB聚合显存,NVFP4量化版仍需600GB起步),部署门槛的下降是来源强调的核心卖点之一。


六、团队动荡:四条曲线背道而驰

来源中关于团队的事实陈述:

来源的判断(推断):"人才在加速流失,模型在加速狂飙。这两条背道而驰的曲线,成了AI行业中最具代表性的一幕"。这是来源编辑视角下的解读,并非可验证的事实结论。


七、局限性说明

基于来源信息,需要向读者提示以下局限:

  1. 评测基准来源单一:上述性能数据均出自新智元报道转述,未链接到第三方独立评测机构的具体分数。
  2. 对比范围有限:来源中提到的对比对象主要是前代Inkling与DeepSeek V4 Flash,并未与同期闭源旗舰模型(如GPT系列、Claude系列、Gemini系列)进行直接对比。
  3. "反超"的具体含义未细化:来源称Inkling-Small在多个基准上"堪比甚至超越"前代,但未提供每一项的详细分差。
  4. 多模态表现有保留:来源承认图表理解、视觉推理、语音理解、长音频推理"接近"原版,但用词为"接近"而非"超越"。
  5. 团队稳定性风险:核心人员持续流失,长期迭代能力是来源隐含但未明说的不确定因素。

八、实践建议

针对来源中可直接落地的信息,给出以下建议:


九、结论

基于来源材料,可以确认的事实层面结论是:Thinking Machines在翁荔回归OpenAI后的第三天,发布了一款276B总参数、12B激活参数、100万token上下文、原生多模态的MoE模型Inkling-Small,并通过on-policy蒸馏加两周智能体RL的训练流程,使其在多个公开基准上实现了对前代975B Inkling以及DeepSeek V4 Flash的反超或追平。来源同时披露,公司六位联创中已有三位回到OpenAI,仅剩两人留守。

来源编辑将这一现象概括为"通向ASI的必经之路",但这属于来源的推断性判断,读者在引用时应加以区分。


来源

新智元:《翁荔刚回OpenAI,Thinking Machines反手甩出新模型》,2026-08-03。原文链接:https://aiera.com.cn/2026/08/01/other/admin/106752/%e7%bf%81%e8%8d%94%e5%88%9a%e5%9b%9eopenai%ef%bc%8cthinking-machines%e5%8f%8d%e6%89%8b%e7%94%a9%e5%87%ba%e6%96%b0%e6%a8%a1%e5%9e%8b/

参考资料:https://thinkingmachines.ai/news/inkling-small/

以 AI 之力,筑未来之境

现在注册,立即免费获赠 200 次大模型调用权益

免费注册 →