DLER:正确执行长度惩罚——通过强化学习激励每个 token 的智能效率
机器学习
2025-10-20 v1 人工智能
计算与语言
摘要
推理语言模型如 OpenAI-o1、DeepSeek-R1 和 Qwen 通过扩展思考链实现卓越性能,但常常生成不必要的冗长输出。最大化每个 token 的智能效率——相对于响应长度的准确率——仍是未解决的问题。我们重新审视最简单的长度惩罚——截断——的强化学习(RL),并指出准确率下降并非源于缺乏复杂惩罚,而是源于 RL 优化不足。我们识别出三个关键挑战:(i)优势估计中的偏差大,(ii)熵崩溃,(iii)奖励信号稀疏。我们通过做正确的长度惩罚(DLER)来解决这些问题,这是一种结合批量奖励归一化、更高裁剪、动态抽样和简单截断长度惩罚的训练配方。DLER 实现了准确率-效率的最佳权衡,使输出长度缩短超过 70%,同时超越所有以前的基线准确率。它还改进了测试时扩展性能:相较于 DeepSeek-R1-7B,DLER-7B 可并行生成多个简洁响应,准确率提高 28%,且延迟更低。我们进一步引入难度感知 DLER,通过在更容易的问题上自适应收紧截断来获得额外的效率收益。我们还提出一种更新选择性合并方法,在保留基线准确率的同时保留 DLER 模型的简洁推理能力,这在 RL 训练数据稀缺的场景中非常有用。
引用
@article{arxiv.2510.15110,
title = {DLER: Doing Length pEnalty Right - Incentivizing More Intelligence per Token via Reinforcement Learning},
author = {Shih-Yang Liu and Xin Dong and Ximing Lu and Shizhe Diao and Mingjie Liu and Min-Hung Chen and Hongxu Yin and Yu-Chiang Frank Wang and Kwang-Ting Cheng and Yejin Choi and Jan Kautz and Pavlo Molchanov},
journal= {arXiv preprint arXiv:2510.15110},
year = {2025}
}
备注
NVIDIA-Tech Report