MODULE // PAPERS

safety影响力 90.0

EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models

本文提出了一种名为 EchoCoT 的多步攻击方法,能够通过黑盒 API 交互,从闭源大型推理模型(LRM)中近乎逐字地提取其隐藏的思维链(Chain-of-Thought, CoT)内容,从而将“隐藏思维链不可见”这一安全假设彻底打破。

arXiv 2608.20055Yiting Qu, Ziqing Yang, Chi Cui, Ye Leng, Junjie Chu, Yang Zhang

EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models

一句话概括

本文提出了一种名为 EchoCoT 的多步攻击方法,能够通过黑盒 API 交互,从闭源大型推理模型(LRM)中近乎逐字地提取其隐藏的思维链(Chain-of-Thought, CoT)内容,从而将“隐藏思维链不可见”这一安全假设彻底打破。

问题背景

近年来,以 OpenAI o1、Gemini 等为代表的前沿大型推理模型(LRM)在回答复杂问题时,会在内部生成一段详细的思维链(CoT),用于逐步推理。然而,出于商业保护和防止知识蒸馏的考虑,这些模型的供应商通常只向用户返回最终答案,而将完整的 CoT 视为“隐藏资产”,不对外公开。

此前的研究大多关注如何通过提示词工程(如“让我们一步步思考”)来诱导模型输出显式推理过程,但对于模型内部真正生成的隐藏 CoT,能否被直接提取,学界几乎没有系统性研究。本文作者敏锐地指出:如果隐藏 CoT 可以通过 API 交互被近乎逐字地还原,那么这些模型的核心推理资产将面临严重的安全风险。这一问题的核心在于:黑盒模型只暴露最终输出,攻击者如何获得足够的“反馈信号”来逐步逼近隐藏的 CoT?

方法要点

EchoCoT 的核心创新在于发现了一个此前被忽视的“推理重放表面”(reasoning replay surface)——即工具调用(tool calls)环节。在支持工具调用的 LRM 中,模型在推理过程中会多次调用外部工具(如搜索、计算器),而每次工具调用前后,API 会返回一些中间状态信息(如工具输入、输出格式、调用参数等)。这些信息虽然不直接包含 CoT 文本,但可以作为“保真度信号”(fidelity signals),帮助攻击者判断当前提取的 CoT 片段是否与真实隐藏 CoT 一致。

基于这一观察,EchoCoT 采用多步迭代攻击策略:

  1. 初始注入:构造一个特殊的提示词,要求模型在工具调用过程中“回显”其内部推理步骤。
  2. 信号反馈:利用 API 返回的工具调用参数、输出长度、token 分布等作为保真度信号,判断提取结果的准确性。
  3. 迭代优化:根据反馈信号调整注入轨迹(injection trajectory),逐步逼近真实 CoT。
  4. 通用化搜索:作者进一步设计了一个基于 LLM 的自动优化框架,能够在不同数据集上自动搜索有效的通用注入轨迹,无需针对每个问题单独手工设计攻击。

关键结论

基于摘要内容,可合理推断以下结论:

  • 开源模型上的高成功率:在三个开源 LRM 上,EchoCoT 实现了最高 66.4% 的近乎逐字提取成功率,且提取的 CoT 长度与目标长度误差在 10% 以内,至少 90% 的 token 与目标完全匹配。这表明该方法在可访问内部结构的模型上效果显著。

  • 跨数据集泛化能力:同一注入轨迹可以迁移到未见过的数据集上,在相同标准下提取成功率最高可达 80%。这说明攻击并非针对特定问题过拟合,而是具有一定的通用性。

  • 闭源模型上的有效性:在五个前沿闭源 LRM(包括 Gemini-2.5)上,提取出的 CoT 与供应商报告的逻辑长度及公开的 CoT 摘要高度吻合。特别地,在 Gemini-2.5 上成功提取了 33,463 个 token 的 CoT,而目标 CoT 为 32,948 个 token,长度几乎完全一致。

  • 安全风险确认:摘要明确指出,这些结果将隐藏 CoT 提取确立为一种实际可行的安全威胁,凸显了保护隐藏 CoT 资产的必要性。

需要说明的是,摘要未给出闭源模型上“逐字匹配率”的具体数值,仅提到“substantial fraction”与报告长度和摘要“closely align”,因此闭源模型上的精确提取率尚不明确。

读后思考 / 适用场景

这篇论文的价值不仅在于展示了一种攻击方法,更在于它重新定义了“隐藏”的含义。过去我们默认黑盒 API 返回的只有最终答案,但 EchoCoT 表明,工具调用这一看似无害的接口,实际上泄露了大量内部推理状态。这提醒我们:在 AI 安全领域,“隐藏”并不等于“不存在”,任何暴露给用户的中间信号都可能成为攻击面。

从适用场景来看,EchoCoT 至少有以下几类用途:

  • 安全审计:模型供应商可以用类似方法测试自家模型的 CoT 泄露风险,评估现有防护措施的有效性。
  • 可解释性研究:对于无法访问内部结构的前沿模型,这种方法为研究者提供了一种“窥探”其推理过程的途径,有助于理解模型的行为模式。
  • 知识蒸馏:虽然这不一定是作者的初衷,但该方法客观上为从闭源模型中提取推理知识提供了技术路径,可能引发商业伦理争议。

局限与开放问题

尽管结果令人震撼,但 EchoCoT 仍存在若干未解决的问题:

  • 闭源模型的精确匹配率未知:摘要仅报告了闭源模型上提取 CoT 与报告长度“接近”,但未给出逐字匹配的精确比例。考虑到闭源模型可能对输出进行后处理或过滤,实际提取的保真度可能低于开源模型。

  • 攻击成本与稳定性:多步迭代攻击需要多次 API 调用,且依赖工具调用这一特定接口。如果模型供应商禁用工具调用或对中间输出进行脱敏,该方法是否仍然有效,摘要未给出答案。

  • 防护对策的缺失:论文指出了风险,但未提出具体的防御方案。如何在不牺牲工具调用功能的前提下,防止 CoT 被回显提取,是一个亟待解决的工程问题。

  • 伦理与合规边界:该攻击方法可能被滥用,论文的发布本身也面临“双重用途”困境。如何在学术自由与安全防护之间取得平衡,是社区需要共同讨论的议题。

总体而言,EchoCoT 是一项具有里程碑意义的安全研究,它用实证结果告诉我们:前沿模型的“思维”并非不可见,只是我们尚未找到正确的窥视角度。

本页为科普精读;细节以 arXiv 原文为准。就本篇提问请点左下角「论文研读助手」。