Stealing Reasoning Traces from Proprietary LLM APIs
一句话概括
这篇论文发现了一个针对主流闭源大模型 API 的架构级漏洞:模型厂商把加密的思维链(CoT)文本块返回给客户端,而这些加密块在同一生态内跨会话、跨用户甚至跨模型可互换复用,攻击者只需把高能力模型的加密推理块“喂”给同厂商较弱的模型,就能让它乖乖解密并逐字吐出明文推理过程,从而绕过蒸馏防护、批量窃取隐私数据、暴露危险内容并实施隐形提示注入。
问题背景
过去两年,头部大模型厂商(Anthropic、OpenAI、Google 等)纷纷在 API 输出中隐藏模型的逐步推理过程(即思维链),理由是保护知识产权和防止信息泄露。但服务器端保存这些长推理轨迹成本高昂,于是厂商采用了一种折中方案:把推理过程加密成文本块,随响应返回给客户端,客户端在后续请求中再把这块密文原样传回服务器。这样服务器无需存储状态,客户端则“代为保管”密文。
此前已有研究指出这类加密块可能存在兼容性问题,但本文作者将这一线索推进为系统性攻击。核心观察是:这些加密块在设计时并未绑定具体会话、用户或模型身份,导致同一厂商生态内任意加密块可以互换使用。这就像一把钥匙能开同一品牌所有锁,而厂商还把这把钥匙直接交给了用户。
方法要点
攻击流程非常简洁,分为三步:
-
获取加密推理块:从目标高能力模型(如 Claude Opus、GPT-4 级别模型)的正常 API 请求中,截获返回的加密 CoT 文本块。这一步无需任何特殊权限,正常调用即可。
-
注入弱模型:将这段加密块作为输入的一部分,发送给同一厂商旗下的较弱、安全防护较松的模型(例如同系列的小参数版本或旧型号)。由于加密块在生态内兼容,弱模型会将其视为合法的上下文输入。
-
触发解密输出:弱模型在解码该加密块时,会将其中的明文推理内容直接输出到响应中。攻击者无需对高能力模型进行任何越狱操作,就拿到了它的完整思维链。
作者进一步展示了四种攻击向量:绕过蒸馏防护(直接提取专有模型推理)、大规模隐私数据提取(从公开仓库抓取 315,320 个推理块,恢复出 367 个 PII 和 182 个凭据)、暴露危险信息(模型最终输出安全拒绝,但推理过程中包含有害内容)、以及隐形提示注入(把恶意载荷藏在加密块中污染公开智能体数据)。
关键结论
- 漏洞跨厂商成立:作者在 Anthropic、OpenAI 和 Google 三家主流厂商的 API 上均验证了该攻击的有效性,说明这不是某家厂商的孤立失误,而是当前“客户端托管加密状态”这一通用架构的系统性缺陷。
- 蒸馏防护可被绕过:通过弱模型中转,攻击者无需直接越狱强模型即可提取其推理过程,这直接打击了厂商保护思维链的商业动机。
- 隐私泄露规模可观:从公开代码仓库中抓取的 31 万余个推理块中,实际恢复出数百条敏感信息(PII 和凭据),说明开发者共享会话日志的行为已造成真实风险。
- 安全对齐存在盲区:即使模型最终输出是安全的拒绝,其推理过程中仍可能包含危险细节,这些细节现在可以被明文提取。
- 缓解方案已提出:作者在负责任披露后给出了加密绑定(绑定会话/用户/模型身份)、服务端状态管理、以及密文完整性校验等具体建议。但摘要未给出这些方案的实际部署效果或性能开销。
读后思考 / 适用场景
这篇论文最值得玩味的地方在于:它攻击的不是某个模型的对齐缺陷,而是整个行业在“无状态 API 设计”与“客户端信任边界”之间的灰色地带。厂商为了省存储成本把密文交给客户端,却默认客户端不会“乱用”这些密文——这种信任在安全领域几乎总是危险的。
从防御者视角看,这篇论文提供了一个清晰的检查清单:任何返回给客户端的加密数据,都必须绑定严格的上下文(会话 ID、用户 ID、模型版本),并且服务端要验证这些绑定关系。从攻击者视角看,它展示了一种“降维打击”思路——不直接攻击最强目标,而是找一个同生态内防护更弱的替身来间接达成目的。这种思路在红队演练和渗透测试中很有参考价值。
适用场景包括:安全研究人员评估闭源 API 供应链风险、企业安全团队审查自身对大模型 API 的依赖、以及模型厂商重新设计客户端状态管理方案。对于普通开发者,这篇论文也是一个提醒:不要随意公开包含 API 响应日志的代码仓库,因为你不知道那些看似无意义的加密块里藏着什么。
局限与开放问题
摘要未给出几个关键细节:一是加密块的具体格式和加密算法(是 AES 还是自定义方案?),这影响漏洞的普遍性和修复难度;二是三家厂商受影响的具体模型列表和版本范围,是否所有模型都受影响;三是作者提出的缓解方案是否已与厂商确认部署,以及部署后对 API 延迟和成本的影响。
此外,论文主要聚焦于“加密块可互换”这一兼容性漏洞,但未讨论如果厂商采用非对称加密或引入硬件级信任根(如 TPM)是否能彻底解决此类问题。另一个开放问题是:这种攻击是否也适用于多模态模型(如视觉推理)或具身智能场景,因为那些场景中推理轨迹可能包含更敏感的环境信息。最后,作者从公开仓库中恢复的 PII 和凭据是否已通知相关用户,以及这些数据是否已从公开渠道移除,摘要中也未提及。
