中文

推理模型中的洞察错觉

人工智能 2026-04-21 v2 计算与语言

摘要

推理模型是否具有“啊哈”时刻? prior work 表明像 DeepSeek-R1-Zero 这样的模型会在推理轨迹中发生突然的中途领悟,导致准确输出,这暗示了模型内在的自我纠正能力。然而,是否存在这些中途推理策略的内在转变实际改善性能的现象尚不明确。本文研究中途推理转移,并对训练运行进行仪表化检测。我们的分析覆盖100万以上推理轨迹、数百个训练检查点、三个推理领域以及多种解码温度和模型架构。我们发现推理转移罕见且训练后并不增多,且少数提升准确性,表明它们不对应 prior 对模型洞察的感知。然而,其效果随模型不确定性而变化。基于这一发现,我们展示人为触发的外在性转移在高熵下可可靠提升准确性。我们的发现表明,中途推理转移是推理行为不稳定的症状,而非自我纠正的内在机制。

关键词

引用

@article{arxiv.2601.00514,
  title  = {The Illusion of Insight in Reasoning Models},
  author = {Liv G. d'Aliberti and Manoel Horta Ribeiro},
  journal= {arXiv preprint arXiv:2601.00514},
  year   = {2026}
}