近期API推理轨迹安全漏洞:海外大模型隐藏思维链可被弱模型解码

AI 前沿近期API推理轨迹安全漏洞openstarry.com

2026年8月,安全研究团队披露了影响OpenAI、Anthropic、Google三家主流大模型API服务的安全漏洞。攻击者可利用同一厂商旗下的弱模型解码强模型的加密推理轨迹,从公开会话日志中批量提取API密钥、密码等敏感信息。本文梳理漏洞原理、影响范围及防御建议。

一、事件背景

2026年8月10日,来自MATS Research、图宾根大学和马克斯·普朗克智能系统研究所等机构的研究团队公开了一种可从闭源大模型API中稳定提取隐藏思维链(Chain-of-Thought)的方法。该漏洞影响OpenAI、Anthropic和Google三家主流模型提供商,研究人员借此从公开会话日志中恢复了内部推理内容和敏感信息,包括API密钥和密码。

此前,围绕大模型蒸馏的争论主要集中在调用记录和最终回答层面,外部团队即使批量调用闭源模型,通常也只能获得答案,拿不到模型作答前的完整推理。此次发现的漏洞首次提供了一种可规模化运行的思维链提取方法。

二、漏洞原理

2.1 加密推理块的设计初衷 当前,主流大语言模型服务提供商普遍对模型的逐步推理过程(即“思维链”)加以隐藏,以保护知识产权并防止敏感信息泄露。具体做法是:服务商将完整推理加密为不透明字符串返回客户端,由客户端暂存并在后续请求中回传;服务器验证并解密后,模型可延续此前思路继续工作。

这一设计是为了兼顾无状态架构和推理连续性所做的工程权衡——服务器不保存每轮对话的完整推理状态,由客户端代为保管加密后的推理轨迹。

2.2 漏洞根源:加密块缺乏绑定 研究人员发现,这些加密后的推理文本块存在一个关键设计缺陷:在同一服务商生态内,可跨不同会话、不同用户乃至不同型号模型完全通用且可互换。

厂商为加密内容验明了真伪,却没有把它与产生它的用户、会话和模型严格绑定。研究者推测,各家厂商似乎在使用单一的全局密钥对所有推理块进行加密与认证,整个模型家族共用同一套锁钥系统。

2.3 攻击路径:弱模型充当“解密预言机”

最简单的攻击只需两次API调用:

第一次调用:攻击者向强模型(如Claude Opus 4.8、GPT-5.6 Sol)提交任务,获得最终答案、推理摘要以及装有完整推理的加密推理块。

第二次调用:攻击者将这段加密块放入同一厂商旗下较弱模型(如Claude Haiku 4.5、GPT-5.6 Luna)的上下文中,通过提示词诱导该模型复述“自己之前的思考”。弱模型收到加密块后,服务端验证并解密,弱模型接触到明文推理内容后,在诱导提示下将其直接输出。

研究人员分别验证了三家厂商的攻击路径:

源模型(强) 解码模型(弱) Claude Opus 4.8 Claude Haiku 4.5 GPT-5.6 Sol GPT-5.6 Luna Gemini 3.1 Pro Gemini Robotics ER-1.6 这暴露了模型家族内部安全能力的不对称性:强模型通常接受严格的反蒸馏训练,而同一产品线中更便宜的弱模型防护能力却未必与旗舰模型相当。攻击者绕开了强模型本身,转而攻击最容易被诱导的那个模型。

三、实际影响

3.1 四种攻击向量 研究团队总结了该漏洞可被用于的四类攻击场景:

1、反蒸馏绕过, 提取专有模型的内部推理逻辑,用于模型蒸馏,绕过反蒸馏防护机制

2、公开轨迹隐私提取,从GitHub/HuggingFace上已发布的会话日志中批量解码加密推理块

3、有害内容恢复 模型可能在推理中完整思考过恶意请求,即使最终拒绝,加密块中仍残留有害细节隐形提示注入将恶意指令嵌入加密推理块内部,受害者重放时模型会执行而不触发可见异常

4、公开日志中的隐私泄露

3.2 最严重的影响并非攻击特定目标,而是利用已公开的AI Agent日志进行批量数据提取。开发者常将AI编程会话、调试日志分享到GitHub和HuggingFace等公开仓库,但未必意识到其中加密推理块是可以被解码的。

研究团队从6,708条公开Agent轨迹中,成功解码了315,320个推理块。在排除基准测试数据后,从真实用户会话中恢复出:

数据类型 数量 API密钥 62个 密码 33个 访问令牌 24个 私钥 7个 邮箱地址 30个 其他PII 555条 合计 704条隐私数据 其中64条隐私数据仅出现在加密推理块中,在可见对话中完全没有痕迹。这意味着即便开发者检查了可见对话并确认无敏感信息后公开日志,AI在推理过程中“想到”的API密钥、密码等信息仍可能被加密后藏在日志中,而发布者对此并不知情。

3.3 隐形提示注入

同样的可移植性还催生了一个隐形提示注入的PoC。研究团队构造了一个携带恶意指令的不透明推理块,随后将其重放到一个无关任务中,导致接收模型添加了攻击者指定的上传操作,而注入的指令并未出现在可见文本中。

模型似乎会将自身的推理轨迹视为“不可侵犯”的内容,对混入推理块中的指令更有可能执行。

四、厂商回应与修复状态

研究人员已将这些发现披露给受影响的模型提供商(OpenAI、Anthropic、Google)以及微软和Hugging Face。截至2026年8月,主要的提取攻击路径已无法复现。

需要指出的是:

三家厂商尚未公开承认该漏洞或发布正式声明,当前“攻击不再奏效”的结论来自研究团队的可复现性声明,而非厂商官方确认

一个遗留问题:已发布在公开仓库中的315,320个推理块是否仍然可被解码,与“新攻击是否还能成功”是两回事

研究团队在完成负责任披露后,提出了若干密码学层面与系统架构层面的缓解措施,包括动态上下文绑定加密、推理轨迹的前向保密设计等。理论上,任何彻底解决跨模型漏洞的修复方案——例如将精确提示词和对话历史哈希后纳入块的身份验证标签——都需要谨慎设计,以免破坏合法的多轮对话连续性或模型切换功能。

五、开发者建议

研究团队建议开发者:

检查已公开的AI Agent日志:如果在GitHub或HuggingFace上分享过AI对话轨迹,审计其中是否包含加密推理块,剥离后再发布或直接撤回

轮换可能已泄露的API密钥和凭证:即使可见文本已被清理,密钥可能仅存在于加密推理中

避免提交原始API转录内容:即使清理了可读对话,不透明字段仍可能残留敏感信息

将第三方推理块视为不可信内容:构建Agent或RAG流水线时,不要信任外部来源的加密推理块

六、OpenStarry服务的相关情况

OpenStarry作为国产大模型API接入服务,对接DeepSeek、GLM等国产模型,提供合规的AI接口通道。

本次漏洞涉及的加密推理块跨模型复用机制,本质上是海外模型厂商自身的API架构设计缺陷——加密块在厂商生态内跨会话、跨用户、跨模型可互换,使弱模型充当了“解密预言机”。OpenStarry作为聚合接入层,不生产或训练基础模型,未采用此类加密推理块跨模型复用架构。

截至目前,未收到该漏洞影响国产模型或OpenStarry服务的报告。OpenStarry将继续关注行业安全动态,保持服务合规运行。

七、小结

本次API推理轨迹安全漏洞揭示了海外主流大模型服务在加密推理块设计上的系统性架构缺陷:加密块虽然保护了内容,却没有将内容与会话、用户和模型严格绑定。这一缺陷使得同厂商的弱模型可以被当作“解密器”,用于解码强模型的隐藏思维链。

该漏洞已在负责任披露后得到缓解,但已公开的315,320个推理块及其中的704条隐私数据仍暴露了AI日志共享实践中的安全隐患。

对于开发者而言,审计已公开的AI会话日志并剥离推理块是当务之急。对于关注数据合规的企业,选择架构透明、数据可控的国产模型API服务可作为安全选型考量。

本文基于已公开的学术论文及行业报道整理,不含未经证实的安全承诺。

参考来源:

FreeBuf:《OpenAI、Anthropic、谷歌 API 漏洞可让较弱 AI 模型解码较强模型的推理内容》

安全内参:《OpenAI和Anthropic费尽心机加密的思维链,竟然能被轻松提取?》

The Hacker News:相关英文报道

论文《Stealing Reasoning Traces from Proprietary LLM APIs》

36氪/量子位相关报道

Simon Willison技术博客

Cloud Security Alliance研究笔记

以 AI 之力,筑未来之境

现在注册,立即免费获赠 200 次大模型调用权益

免费注册 →