中文

ShorterBetter:引导推理模型找到最优推理长度以实现高效推理

人工智能 2025-12-03 v4

摘要

最近的模型如 OpenAI o1 和 DeepSeek-R1 通过生成扩展的链式思维(Chain-of-Thought, CoT)轨迹,在推理密集型任务上显示出强大的性能。虽然更长的推理有助于对复杂问题的解题路径进行彻底探索,但也常常导致低效和冗余的输出——这被常见地描述为过度思考。在本文中,我们提出了 ShorterBetter,一种简单而有效的强化学习方法,使推理模型能够在无需人工监督的情况下学习其自身的最优 CoT 长度。我们定义样本最优长度(Sample Optimal Length, SOL)为多个生成结果中最短正确响应的长度,作为动态奖励信号引导模型实现高效推理。应用于 DeepSeek-Distill-Qwen-1.5B/7B 作为基础模型时,ShorterBetter 在领域内和领域外推理任务中实现了 50%-80% 的输出长度减少,同时保持准确率。我们的推理轨迹分析显示,ShorterBetter 通过减少不必要的重复、过度自我验证和对备选方案的过度探索,细化了推理轨迹的结构。

关键词

引用

@article{arxiv.2504.21370,
  title  = {ShorterBetter: Guiding Reasoning Models to Find Optimal Inference Length for Efficient Reasoning},
  author = {Jingyang Yi and Jiazheng Wang and Sida Li},
  journal= {arXiv preprint arXiv:2504.21370},
  year   = {2025}
}

备注

updated project website