中文

大规模推理模型并未直觉思考:对思考轨迹可靠性的新证据

机器学习 2025-07-02 v1

摘要

通过强化学习(RL)训练的大型语言模型(LLM)最近在推理基准测试中取得了令人瞩目的成绩。然而,日益增长的证据表明,这些模型常生成更长但无效的思考链(CoTs),质疑这些基准收益是否反映真正的推理改进。我们提供了新的证据表明模型存在“过度思考”问题,即即使明确提供正确解答,这些模型也会忽略正确解答,继续生成不必要的推理步骤,往往导致错误结论。我们针对三款最先进模型使用AIME2024数学基准测试,揭示了这些模型整合纠正性信息能力的关键局限,为实现稳健且可解释的推理提出了新挑战。

关键词

引用

@article{arxiv.2507.00711,
  title  = {Large Reasoning Models are not thinking straight: on the unreliability of thinking trajectories},
  author = {Jhouben Cuesta-Ramirez and Samuel Beaussant and Mehdi Mounsif},
  journal= {arXiv preprint arXiv:2507.00711},
  year   = {2025}
}

备注

Accepted to KONVENS 2025