EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models
一句话概括
EchoCoT 能从黑盒大型推理模型(Large Reasoning Model, LRM)中近乎逐字提取隐藏思维链(Chain-of-Thought, CoT)。它把「隐藏 CoT 不可见」这一安全假设变成了实际风险。
速览
- 任务:系统研究能否从黑盒 LRM 的 API 交互中近乎逐字提取隐藏 CoT。
- 方法:发现工具调用间的「推理重放表面」,用 API 返回的保真度信号迭代提取,并用基于 LLM 的框架自动搜索通用注入轨迹。
- 关键数字:开源 LRM 上最高 66.4% 近乎逐字提取成功率,长度误差在 10% 以内,至少 90% 的 token 完全匹配;同一轨迹在未见数据集上最高 80% 成功率;Gemini-2.5 上提取 33,463 个 token,目标为 32,948 个 token。
- 数据与开源:在 3 个开源与 5 个前沿闭源 LRM 上评估;开源情况摘要未给出。
问题背景
以 OpenAI o1、Gemini 等为代表的前沿 LRM 在回答复杂问题时,会在内部生成一段详细的 CoT。这段 CoT 用于逐步推理。
出于商业保护和防止知识蒸馏的考虑,供应商通常只返回最终答案。完整 CoT 被当作「隐藏资产」,不对外公开。
此前研究多关注用提示词工程诱导模型输出显式推理过程。对于模型内部真正生成的隐藏 CoT 能否被直接提取,学界几乎没有系统性研究。
本文提出的核心问题是:黑盒模型只暴露最终输出。攻击者如何获得足够的反馈信号,逐步逼近隐藏的 CoT?
方法要点
EchoCoT 的核心创新是发现了一个此前被忽视的「推理重放表面」(reasoning replay surface)。这一表面位于工具调用(tool calls)环节。
在支持工具调用的 LRM 中,模型推理时会多次调用外部工具,如搜索、计算器。每次调用前后,API 会返回一些中间状态信息,如工具输入、输出格式、调用参数。
这些信息不直接包含 CoT 文本。但它们可作为「保真度信号」(fidelity signals),帮助攻击者判断当前提取的 CoT 片段是否与真实隐藏 CoT 一致。
基于这一观察,EchoCoT 采用多步迭代攻击策略:
- 初始注入:构造特殊提示词,要求模型在工具调用过程中「回显」其内部推理步骤。
- 信号反馈:利用 API 返回的工具调用参数、输出长度、token 分布等作为保真度信号,判断提取结果的准确性。
- 迭代优化:根据反馈信号调整注入轨迹(injection trajectory),逐步逼近真实 CoT。
- 通用化搜索:设计基于 LLM 的自动优化框架。它在不同数据集上自动搜索有效的通用注入轨迹,无需针对每个问题单独手工设计攻击。
关键结论
- 开源模型上的高成功率:在 3 个开源 LRM 上,EchoCoT 实现最高 66.4% 的近乎逐字提取成功率。提取的 CoT 长度与目标长度误差在 10% 以内,至少 90% 的 token 与目标完全匹配。
- 跨数据集泛化能力:同一注入轨迹可迁移到未见过的数据集。在相同标准下,提取成功率最高可达 80%。这说明攻击并非针对特定问题过拟合。
- 闭源模型上的有效性:在 5 个前沿闭源 LRM(包括 Gemini-2.5)上,提取出的 CoT 与供应商报告的逻辑长度及公开的 CoT 摘要高度吻合。在 Gemini-2.5 上成功提取 33,463 个 token 的 CoT,目标 CoT 为 32,948 个 token,长度几乎完全一致。
- 安全风险确认:摘要明确指出,这些结果将隐藏 CoT 提取确立为一种实际可行的安全威胁。它凸显了保护隐藏 CoT 资产的必要性。
需要说明的是,摘要未给出闭源模型上「逐字匹配率」的具体数值。摘要仅提到「substantial fraction」与报告长度和摘要「closely align」。因此闭源模型上的精确提取率尚不明确。
读后思考
这篇论文的价值不只在于展示了一种攻击方法。它更在于重新定义了「隐藏」的含义。
过去我们默认黑盒 API 返回的只有最终答案。EchoCoT 表明,工具调用这一看似无害的接口,实际上泄露了大量内部推理状态。
这提醒我们:在 AI 安全领域,「隐藏」并不等于「不存在」。任何暴露给用户的中间信号都可能成为攻击面。
从适用场景来看,EchoCoT 至少有以下几类用途:
- 安全审计:模型供应商可用类似方法测试自家模型的 CoT 泄露风险,评估现有防护措施的有效性。
- 可解释性研究:对于无法访问内部结构的前沿模型,这种方法为研究者提供了一种「窥探」其推理过程的途径,有助于理解模型的行为模式。
- 知识蒸馏:该方法客观上为从闭源模型中提取推理知识提供了技术路径,可能引发商业伦理争议。
局限与开放问题
- 闭源模型的精确匹配率未知:摘要仅报告闭源模型上提取 CoT 与报告长度「接近」,未给出逐字匹配的精确比例。闭源模型可能对输出进行后处理或过滤,实际提取的保真度可能低于开源模型。
- 攻击成本与稳定性:多步迭代攻击需要多次 API 调用,且依赖工具调用这一特定接口。如果供应商禁用工具调用或对中间输出进行脱敏,该方法是否仍然有效,摘要未给出答案。
- 防护对策的缺失:论文指出了风险,但未提出具体的防御方案。如何在不牺牲工具调用功能的前提下,防止 CoT 被回显提取,是一个亟待解决的工程问题。
- 伦理与合规边界:该攻击方法可能被滥用,论文的发布本身也面临「双重用途」困境。如何在学术自由与安全防护之间取得平衡,是社区需要共同讨论的议题。
总体而言,EchoCoT 用实证结果说明:前沿模型的「思维」并非不可见。我们只是尚未找到正确的窥视角度。