中文

思维链推理中的隐式错误感知:信号是诊断性的而非因果性的

计算与语言 2026-05-12 v1 人工智能 机器学习

摘要

思维链(CoT)提示假设生成的推理反映了模型的内部计算。我们以一种具体且可测量的方式表明该假设是错误的:模型在内部检测到了自身的推理错误,但在外部却对其表现出信心。对隐藏状态的线性探测能以 0.95 的 AUROC 预测轨迹正确性——从第一个推理步骤即达到 0.79——而错误轨迹的语言化置信度为 4.55/5,几乎与正确轨迹(4.87/5)相同。文本表面分类器在相同数据上仅达到 0.59,证实了生成文本中不可见的 0.20 分差距。这种隐式错误感知在三个模型族(Qwen、Llama、Phi)、1.5B-72B 参数以及 RL 训练的推理模型(DeepSeek-R1,0.852 AUROC)中均成立。自然的问题是该信号能否修复其检测到的错误。答案是不能。四种干预措施——激活引导、探测引导的 best-of-N、自我纠正和激活修补——均告失败;修补甚至完全破坏了输出的连贯性。该信号是诊断性的,而非因果性的:它是计算质量的读数,而非重定向计算的杠杆。这界定了机制可解释性的一个边界:推理过程中的错误表示与先前工作已成功编辑的事实知识表示存在根本不同。

关键词

引用

@article{arxiv.2605.09502,
  title  = {Hidden Error Awareness in Chain-of-Thought Reasoning: The Signal Is Diagnostic, Not Causal},
  author = {Aojie Yuan and Zhiyuan Julian Su and Haiyue Zhang and Yi Nian and Yue Zhao},
  journal= {arXiv preprint arXiv:2605.09502},
  year   = {2026}
}

备注

10 pages, 5 figures, 10 tables.Mechanistic Interpretability @ ICML 2026