EMON TECH MEDIA · PAPERS — DNA·52CD39

EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models

本文提出了一种名为 EchoCoT 的多步攻击方法,能够通过黑盒 API 交互,从闭源大型推理模型(LRM)中近乎逐字地提取其隐藏的思维链(Chain-of-Thought, CoT)内容,从而将“隐藏思维链不可见”这一安全假设彻底打破。

发表日期

作者

Yiting Qu, Ziqing Yang, Chi Cui, Ye Leng, Junjie Chu, Yang Zhang

影响力

90.0

阅读时长

约 6 分钟

标签

安全对齐推理

EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models

一句话概括

EchoCoT 能从黑盒大型推理模型(Large Reasoning Model, LRM)中近乎逐字提取隐藏思维链(Chain-of-Thought, CoT)。它把「隐藏 CoT 不可见」这一安全假设变成了实际风险。

速览

  • 任务:系统研究能否从黑盒 LRM 的 API 交互中近乎逐字提取隐藏 CoT。
  • 方法:发现工具调用间的「推理重放表面」,用 API 返回的保真度信号迭代提取,并用基于 LLM 的框架自动搜索通用注入轨迹。
  • 关键数字:开源 LRM 上最高 66.4% 近乎逐字提取成功率,长度误差在 10% 以内,至少 90% 的 token 完全匹配;同一轨迹在未见数据集上最高 80% 成功率;Gemini-2.5 上提取 33,463 个 token,目标为 32,948 个 token。
  • 数据与开源:在 3 个开源与 5 个前沿闭源 LRM 上评估;开源情况摘要未给出。

问题背景

以 OpenAI o1、Gemini 等为代表的前沿 LRM 在回答复杂问题时,会在内部生成一段详细的 CoT。这段 CoT 用于逐步推理。

出于商业保护和防止知识蒸馏的考虑,供应商通常只返回最终答案。完整 CoT 被当作「隐藏资产」,不对外公开。

此前研究多关注用提示词工程诱导模型输出显式推理过程。对于模型内部真正生成的隐藏 CoT 能否被直接提取,学界几乎没有系统性研究。

本文提出的核心问题是:黑盒模型只暴露最终输出。攻击者如何获得足够的反馈信号,逐步逼近隐藏的 CoT?

方法要点

EchoCoT 的核心创新是发现了一个此前被忽视的「推理重放表面」(reasoning replay surface)。这一表面位于工具调用(tool calls)环节。

在支持工具调用的 LRM 中,模型推理时会多次调用外部工具,如搜索、计算器。每次调用前后,API 会返回一些中间状态信息,如工具输入、输出格式、调用参数。

这些信息不直接包含 CoT 文本。但它们可作为「保真度信号」(fidelity signals),帮助攻击者判断当前提取的 CoT 片段是否与真实隐藏 CoT 一致。

基于这一观察,EchoCoT 采用多步迭代攻击策略:

  1. 初始注入:构造特殊提示词,要求模型在工具调用过程中「回显」其内部推理步骤。
  2. 信号反馈:利用 API 返回的工具调用参数、输出长度、token 分布等作为保真度信号,判断提取结果的准确性。
  3. 迭代优化:根据反馈信号调整注入轨迹(injection trajectory),逐步逼近真实 CoT。
  4. 通用化搜索:设计基于 LLM 的自动优化框架。它在不同数据集上自动搜索有效的通用注入轨迹,无需针对每个问题单独手工设计攻击。

关键结论

  • 开源模型上的高成功率:在 3 个开源 LRM 上,EchoCoT 实现最高 66.4% 的近乎逐字提取成功率。提取的 CoT 长度与目标长度误差在 10% 以内,至少 90% 的 token 与目标完全匹配。
  • 跨数据集泛化能力:同一注入轨迹可迁移到未见过的数据集。在相同标准下,提取成功率最高可达 80%。这说明攻击并非针对特定问题过拟合。
  • 闭源模型上的有效性:在 5 个前沿闭源 LRM(包括 Gemini-2.5)上,提取出的 CoT 与供应商报告的逻辑长度及公开的 CoT 摘要高度吻合。在 Gemini-2.5 上成功提取 33,463 个 token 的 CoT,目标 CoT 为 32,948 个 token,长度几乎完全一致。
  • 安全风险确认:摘要明确指出,这些结果将隐藏 CoT 提取确立为一种实际可行的安全威胁。它凸显了保护隐藏 CoT 资产的必要性。

需要说明的是,摘要未给出闭源模型上「逐字匹配率」的具体数值。摘要仅提到「substantial fraction」与报告长度和摘要「closely align」。因此闭源模型上的精确提取率尚不明确。

读后思考

这篇论文的价值不只在于展示了一种攻击方法。它更在于重新定义了「隐藏」的含义。

过去我们默认黑盒 API 返回的只有最终答案。EchoCoT 表明,工具调用这一看似无害的接口,实际上泄露了大量内部推理状态。

这提醒我们:在 AI 安全领域,「隐藏」并不等于「不存在」。任何暴露给用户的中间信号都可能成为攻击面。

从适用场景来看,EchoCoT 至少有以下几类用途:

  • 安全审计:模型供应商可用类似方法测试自家模型的 CoT 泄露风险,评估现有防护措施的有效性。
  • 可解释性研究:对于无法访问内部结构的前沿模型,这种方法为研究者提供了一种「窥探」其推理过程的途径,有助于理解模型的行为模式。
  • 知识蒸馏:该方法客观上为从闭源模型中提取推理知识提供了技术路径,可能引发商业伦理争议。

局限与开放问题

  • 闭源模型的精确匹配率未知:摘要仅报告闭源模型上提取 CoT 与报告长度「接近」,未给出逐字匹配的精确比例。闭源模型可能对输出进行后处理或过滤,实际提取的保真度可能低于开源模型。
  • 攻击成本与稳定性:多步迭代攻击需要多次 API 调用,且依赖工具调用这一特定接口。如果供应商禁用工具调用或对中间输出进行脱敏,该方法是否仍然有效,摘要未给出答案。
  • 防护对策的缺失:论文指出了风险,但未提出具体的防御方案。如何在不牺牲工具调用功能的前提下,防止 CoT 被回显提取,是一个亟待解决的工程问题。
  • 伦理与合规边界:该攻击方法可能被滥用,论文的发布本身也面临「双重用途」困境。如何在学术自由与安全防护之间取得平衡,是社区需要共同讨论的议题。

总体而言,EchoCoT 用实证结果说明:前沿模型的「思维」并非不可见。我们只是尚未找到正确的窥视角度。

本页为科普精读;细节以 arXiv 原文为准。就本篇提问请点左下角「论文研读助手」。