无妥协地解决长度膨胀问题:基于群相对奖励重缩放的强化学习
机器学习
2026-03-12 v1 计算与语言
摘要
强化学习显著提升了 LLM 的能力,但存在一个关键问题:长度膨胀,即模型采用冗长或低效的推理方式以最大化奖励。先前的方法难以以通用且无损的方式解决此挑战,主要是因为加法惩罚引入补偿效应,导致优化捷径,而启发式门控策略仅限于二元反馈。为弥合这一鸿沟,我们提出了群相对奖励重缩放 (GR),将长度控制重新表述为乘法性重缩放范式,有效建立了通用、连续且奖励依赖的门控机制。为进一步确保无损优化,我们引入群相对正则化和基于优势的校准,该机制可动态调整实例难度以适应长度预算,并保留高质量轨迹的优势信号。实验上,无论在 RLHF 还是 RLVR 设置下,GR 都能维持与标准 GRPO 相当的训练动力学和下游性能,同时显著减轻长度膨胀,超越最新的长度正则化基线方法。
引用
@article{arxiv.2603.10535,
title = {Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning},
author = {Zichao Li and Jie Lou and Fangchen Dong and Zhiyuan Fan and Mengjie Ren and Hongyu Lin and Xianpei Han and Debing Zhang and Le Sun and Yaojie Lu and Xing Yu},
journal= {arXiv preprint arXiv:2603.10535},
year = {2026}
}