中文

自回归训练中为何会产生不忠实推理?——基于合成实验的研究

机器学习 2026-02-03 v1 人工智能

摘要

大型语言模型(LLM)生成的链式思维(CoT)推理常常不忠实:中间步骤可能在逻辑上不一致,或未能反映导致最终答案的因果关系。尽管已有大量经验性观察,但对 CoT 的基本理解仍缺乏——忠实的 CoT 推理是什么,以及不忠实性如何从自回归训练中产生?我们通过进行受控的合成实验来研究这些问题,通过训练小型 transformer 在带噪声的数据上逐步解决模块化算术表达式,这一任务我们称为算术表达式推理。我们发现,模型可以在训练噪声低于临界阈值时学习到忠实的推理,即其推理步骤因果遵循算术规则;但在更高的噪声水平下,训练动力学表现出从忠实的逐步推理向不忠实的跳过推理的转变,经历一种由预测熵暂时增加特征征征的中间混合模式。机制分析揭示,模型通过解决不一致的推理步骤来编码内部不确定性,这表明自回归训练中隐式自我验证的出现。

关键词

引用

@article{arxiv.2602.01017,
  title  = {How Does Unfaithful Reasoning Emerge from Autoregressive Training? A Study of Synthetic Experiments},
  author = {Fuxin Wang and Amr Alazali and Yiqiao Zhong},
  journal= {arXiv preprint arXiv:2602.01017},
  year   = {2026}
}

备注

25 pages, 23 figures