中文

当链式思考失效时:隐藏状态中的解决方案

计算与语言 2026-04-28 v1 人工智能 机器学习

摘要

链式思考(CoT)的中间推理是计算有用还是仅为解释,取决于链式思考标记是否包含任务相关信息。我们对GSM8K上的CoT进行机制学因果分析,使用激活修补技术:将来自CoT生成的标记级隐藏状态传输到针对相同问题的直接答案运行中,然后测量其对最终答案准确性的影响。在各种模型中,修补后的生成显著高于直接答案提示和原始CoT轨迹,揭示了即使原始轨迹错误,单个CoT标记也可能编码足够的信息来恢复正确答案。这种任务相关信息更常见于正确的CoT运行中,并且在标记之间呈不均匀分布,集中在中后层并在推理轨迹中较早出现。此外,修补语言标记(如动词和实体)携带任务解决信息,可引导生成走向正确的推理,而数学标记编码的是答案邻近内容,很少成功。修补后的输出通常更短,却超过完整CoT轨迹的准确性,表明完整的推理链并非总是必要的。总之,这些发现表明CoT编码了可恢复的、标记级问题解决信息,为理解推理如何被表示及其何时失效提供了新视角。

关键词

引用

@article{arxiv.2604.23351,
  title  = {When Chain-of-Thought Fails, the Solution Hides in the Hidden States},
  author = {Houman Mehrafarin and Amit Parekh and Ioannis Konstas},
  journal= {arXiv preprint arXiv:2604.23351},
  year   = {2026}
}