中文

当推理轨迹变得具有施为性:思维链作为不完美监督通道的步骤级证据

人工智能 2026-05-13 v1

摘要

思维链(CoT)轨迹越来越多地被用于提升语言模型能力和审计模型行为,这隐含地假设了可见的轨迹与决定答案的计算保持同步。我们通过一个步骤级的检测-分类-比较框架来检验这一假设,该框架围绕一个答案承诺代理构建,并通过 Patchscopes、调谐透镜探针和因果方向消融进行交叉验证。在九个模型和七个推理基准上,潜在承诺和显式答案到达平均仅在 61.9% 的步骤上对齐。主要的不匹配模式是虚构性延续:58.0% 的检测到的不匹配事件发生在答案承诺代理已经稳定之后,而轨迹继续产生看似深思熟虑的文本,并且空洞性分析表明,在这些步骤中承诺的答案并未改变。在架构匹配的 Qwen2.5/DeepSeek-R1-Distill 比较中,推理管道改变了失败构成,而非总体对齐度,这在 32B 规模上最为明显,其中虚构步骤减少,而矛盾状态增加。较低的步骤级对齐度也与较大的 CoT 效用相关,这表明从 CoT 中获益最多的设置往往在时间上最不可靠。成对截断和互补的捐赠者-污染测试进一步表明,许多承诺后的文本对最终答案并非承载性的。这些发现表明,CoT 可以保持有用,同时仍然是关于答案何时形成的一个不可靠报告。

关键词

引用

@article{arxiv.2605.11746,
  title  = {When Reasoning Traces Become Performative: Step-Level Evidence that Chain-of-Thought Is an Imperfect Oversight Channel},
  author = {Wenkai Li and Fan Yang and Ananya Hazarika and Shaunak A. Mehta and Koichi Onoue},
  journal= {arXiv preprint arXiv:2605.11746},
  year   = {2026}
}