Reading Between the Dots: Decoding Hidden Computation across Filler Tokens
一句话概括
这篇论文发现,前沿大语言模型在输出无意义的填充词(如点号“......”或数字序列“1,2,3,4”)时,内部其实在进行结构化的多步推理,并且这种“隐藏计算”可以通过分析残差流中的隐藏状态被直接解码出来,准确率高达80-95%。
问题背景
当我们让大语言模型回答一个复杂问题时,通常会期望它输出类似“第一步:...;第二步:...”的思维链(Chain-of-Thought, CoT)。但研究人员发现了一个令人困惑的现象:一些前沿模型(如DeepSeek V3、Kimi K2)在输出完全无意义的填充词——比如一连串的点号“......”或者简单的计数序列“1,2,3,4”——之后,竟然能给出正确答案。这些填充词本身不携带任何语义信息,就像在说“......然后答案就出来了”。
这给AI安全带来了一个根本性挑战:如果我们只能监控模型的表面输出(即它说了什么),那么这种“隐藏计算”就完全避开了行为监控。但论文作者提出了一个关键洞察:隐藏于输出不等于隐藏于我们。模型内部的计算痕迹——即残差流中的隐藏状态——可能仍然可以被读取和理解。
方法要点
论文设计了一套系统的方法来“解码”这种隐藏计算,核心思路是:不要只看模型说了什么,要看它内部在想什么。
任务设计:作者选择了四个任务族,每个任务都需要多步推理:
- 事实检索:如“《哈利·波特》的作者是谁?”,需要先识别实体再检索事实。
- 并行数值组合:如“3+5和2+4的结果分别是多少?”,需要并行计算两个加法。
- 字符串操作:如“将'hello'中的'e'替换为'a'”,需要逐字符操作。
- 上下文计算:如根据前文模式推断后续结果。
解码方法:作者开发了一个无监督解码管道,仅以隐藏状态作为输入,不依赖任何标注数据或训练。具体包括:
- 注意力路由分析:追踪注意力头如何将问题信息通过填充区域“路由”到答案位置。
- Logit透镜读取:在每一层解码残差流,观察中间计算值(如“哈利·波特”对应的作者名)何时出现、如何演变。
- KV缓存移植:将一个示例的填充位置KV缓存移植到另一个示例,观察是否因果性地交换了输出结果。
关键结论
-
隐藏计算是结构化的:在四个任务族上,两个模型(DeepSeek V3、Kimi K2)在填充词上的计算都表现出清晰的模式。注意力机制将问题信息通过填充区域“传递”到答案位置,而不是随机游走。
-
中间结果可读:通过Logit透镜,作者发现事实检索任务中,目标事实(如“J.K. Rowling”)在早期层就已经出现,而组合任务(如数值计算)中,中间结果在后期层逐渐“结晶”成最终答案。这些过程在填充词阶段就已经完成。
-
因果性验证:KV缓存移植实验表明,将一个示例的填充位置缓存移植到另一个示例,可以因果性地改变输出结果。这意味着填充位置的计算确实是决定性的。
-
无监督解码准确率:论文提出的无监督解码管道在四个任务上均达到80-95%的准确率(以最佳LLM评判为准),且不需要任何真实标签或训练。
-
监控可行性的重新定义:这些结果暗示,监控能力不应局限于表面输出,而应扩展到模型完整的计算轨迹。隐藏计算虽然避开了行为监控,但并未避开内部状态监控。
读后思考 / 适用场景
这篇论文最引人深思的启示是:“隐藏”是一个相对概念。当我们说模型“偷偷计算”时,实际上只是它的计算发生在输出层之外,但内部状态仍然可以被读取。这为AI安全提供了一条新思路:与其试图让模型“说清楚”每一步(这可能会被绕过),不如直接监控它的内部计算。
适用场景:
- AI安全审计:检查模型是否在输出无意义内容时进行了隐藏推理,特别是那些可能涉及敏感操作(如代码执行、数据库查询)的场景。
- 可解释性研究:对于不输出思维链的模型,可以通过内部状态解码来理解其推理过程。
- 模型调试:当模型输出看似随机时,内部状态可能揭示出它实际上在正确计算但输出被截断或干扰。
局限与开放问题
-
任务范围有限:论文仅测试了四个任务族,且都是相对简单的多步推理。对于更复杂的任务(如数学证明、长文档理解),隐藏计算是否仍然可解码?摘要未给出。
-
模型依赖性:实验仅基于DeepSeek V3和Kimi K2两个模型。其他架构(如GPT-4、Claude)是否表现出类似的可解码性?摘要未给出。
-
解码的通用性:无监督解码管道在四个任务上表现良好,但这是否意味着对所有隐藏计算都有效?如果模型学会了更复杂的隐藏编码(如加密式计算),解码难度可能急剧上升。
-
监控的实用性:即使能解码隐藏计算,实时监控大规模模型的所有内部状态在工程上是否可行?计算成本如何?这些实际问题论文未涉及。
-
对抗性场景:如果攻击者知道监控方法,是否可以设计出既隐藏计算又隐藏内部状态的“双重隐藏”策略?这是未来安全研究需要面对的挑战。