中文

从绝对到相对:基于群组强化学习中的奖励塑形重新思考

机器学习 2026-02-02 v1

摘要

强化学习已成为提升大型语言模型推理能力的核心方法,其中基于群组的方法如 GRPO 已出现作为高效范式,通过利用群组内部性能差异来优化策略。然而,这些方法通常依赖绝对数值奖励,存在内在局限性。在可验证任务中,相同的群组评估常导致稀疏监督;而在开放性场景中,奖励模型的得分范围不稳定性会削弱基于群组均值的优势估计。为解决这些局限性,我们提出了基于相对奖励的强化学习(RLRR),一个将奖励塑形从绝对评分转向相对排序的框架。此框架之上,我们引入了排序奖励模型,这是一种为群组优化量身定制的列表化偏好模型,直接生成相对排序。通过将原始评估转化为稳健的相对信号,RLRR 有效缓解了信号稀疏性和奖励不稳定性。实验结果表明,RLRR 在推理基准和开放式生成任务上均优于标准基于群组的基线方法,实现了持续的性能提升。

关键词

引用

@article{arxiv.2601.23058,
  title  = {From Absolute to Relative: Rethinking Reward Shaping in Group-Based Reinforcement Learning},
  author = {Wenzhe Niu and Wei He and Zongxia Xie and Jinpeng Ou and Huichuan Fan and Yuchen Ge and Yanru Sun and Ziyin Wang and Yizhao Sun and Chengshun Shi and Jiuchong Gao and Jinghua Hao and Renqing He},
  journal= {arXiv preprint arXiv:2601.23058},
  year   = {2026}
}