中文

停止不必要的反思:通过自适应反思与长度协调惩罚训练高效推理的大推理模型

人工智能 2026-03-02 v2 计算与语言

摘要

大推理模型(LRMs)通过采用测试时扩展,在复杂推理任务上展现了卓越的性能。然而,它们常常生成过长的思维链,这些思维链由大量的反思(如重复的自我质疑和循环推理)驱动,导致高令牌消耗、显著的计算开销和增加的延迟,而并未提高准确性,尤其是在较小的模型中。我们的观察表明,问题复杂性的增加会引发更多过度且不必要的反思,这反过来又降低了准确性并增加了令牌开销。为应对这一挑战,我们提出了自适应反思与长度协调惩罚(ARLCP),这是一种新颖的强化学习框架,旨在动态平衡推理效率与解决方案准确性。ARLCP引入了两项关键创新:(1) 一种反思惩罚,自适应地削减不必要的反思步骤,同时保留必要的推理;(2) 一种根据问题估计复杂度校准的长度惩罚。通过协调这些惩罚,ARLCP鼓励模型生成更简洁有效的推理路径。我们使用DeepSeek-R1-Distill-Qwen-1.5B和DeepSeek-R1-Distill-Qwen-7B模型在五个数学推理基准上评估了我们的方法。实验结果表明,与现有方法相比,ARLCP实现了优越的效率-准确性权衡。对于1.5B模型,它在将平均响应长度减少53.1%的同时,将准确性提高了5.8%。对于7B模型,它在将长度减少35.0%的同时,获得了2.7%的准确性提升。代码已发布在 https://github.com/ZeweiYu1/ARLCP。

关键词

引用

@article{arxiv.2602.12113,
  title  = {Stop Unnecessary Reflection: Training LRMs for Efficient Reasoning with Adaptive Reflection and Length Coordinated Penalty},
  author = {Zewei Yu and Lirong Gao and Yuke Zhu and Bo Zheng and Junbo Zhao and Sheng Guo and Haobo Wang},
  journal= {arXiv preprint arXiv:2602.12113},
  year   = {2026}
}

备注

Accepted to ICLR 2026