中文

在正确之后再缩短:为推理强化学习引入惰性长度惩罚

人工智能 2026-03-17 v3 计算与语言

摘要

大型推理模型,如OpenAI o1或DeepSeek R1,已在推理任务中展现出卓越的性能,但往往伴随长时间的推理路径,造成显著的内存和时间成本。现有方法主要通过引入额外训练数据和阶段来缩短推理路径。本文提出了整合到大型推理模型强化学习过程中的三种关键奖励设计,无需额外训练阶段即可减少响应长度。实验表明,我们的方法显著降低了响应长度,同时保持或甚至提升了性能。在逻辑推理场景下,我们实现了平均按步骤计的响应长度缩短40%,同时性能提升14%。对于数学问题,按步骤计的响应长度缩短33%,且保持性能。

关键词

引用

@article{arxiv.2505.12284,
  title  = {Shorten After You're Right: Lazy Length Penalties for Reasoning RL},
  author = {Danlong Yuan and Tian Xie and Shaohan Huang and Zhuocheng Gong and Huishuai Zhang and Chong Luo and Furu Wei and Dongyan Zhao},
  journal= {arXiv preprint arXiv:2505.12284},
  year   = {2026}
}

备注

Under review