中文

推理之初的困境

计算与语言 2025-10-21 v3

摘要

最近的大型语言模型 (LLM) 取得了显著进展,尤其在通过扩展链式思维 (CoT) 推理方面,通过引入回溯、自省和自纠正等机制,显著提升了复杂推理能力。尽管有此发展,但 LLM 在长链 CoT 推理期间的自纠正能力仍未得到充分探索。与此同时,近期关于“过度思考”的发现表明,这类模型常常进行不必要的冗余推理。本文经验性地表明,第一个推理步骤对最终预测具有远超其他步骤的影响。即,此阶段引入的错误会显著降低后续推理质量。这一现象在各种最先进的开源和闭源推理模型中均得到一致观察。基于这一洞见,我们提出一种高效抽样策略,利用奖励模型识别并保留高质量的第一个推理步骤,同时丢弃次优步骤,在不损失任何准确性的前提下,将推理成本降低最高可达 70%。我们的工作凸显了第一个推理步骤在生成高质量推理轨迹中的核心作用,从而显著提升了抽样效率。

关键词

引用

@article{arxiv.2506.22058,
  title  = {Lost at the Beginning of Reasoning},
  author = {Baohao Liao and Xinyi Chen and Sara Rajaee and Yuhui Xu and Christian Herold and Anders Søgaard and Maarten de Rijke and Christof Monz},
  journal= {arXiv preprint arXiv:2506.22058},
  year   = {2025}
}

备注

remove the benchmark part. (10 pages, 6 figures, 5 tables)