你的组相对优势是有偏的
机器学习
2026-01-23 v2
摘要
来自验证器奖励的强化学习 (RLVR) 已成为一种广泛使用的大语言模型推理任务后训练方法,其中基于分组的方法(如 GRPO 及其变体)获得了广泛采用。这些方法依赖组相对优势估计来避免学习评判器,但其理论性质仍缺乏充分理解。在本工作中,我们揭示了基于分组的强化学习的一个根本问题:组相对优势估计器相对于真实(期望)优势存在固有偏差。我们提供了首个理论分析,表明它系统性地低估了困难提示的优势并高估了简单提示的优势,导致探索与利用的不平衡。为解决此问题,我们提出了历史感知自适应难度加权 (HA-DW),这是一种自适应重加权方案,基于不断演变的难度锚点和训练动态来调整优势估计。理论分析与在五个数学推理基准上的实验表明,将 HA-DW 集成到 GRPO 及其变体中可持续提升性能。我们的结果表明,纠正有偏的优势估计对于鲁棒且高效的 RLVR 训练至关重要。
引用
@article{arxiv.2601.08521,
title = {Your Group-Relative Advantage Is Biased},
author = {Fengkai Yang and Zherui Chen and Xiaohan Wang and Xiaodong Lu and Jiajun Chai and Guojun Yin and Wei Lin and Shuai Ma and Fuzhen Zhuang and Deqing Wang and Yaodong Yang and Jianxin Li and Yikun Ban},
journal= {arXiv preprint arXiv:2601.08521},
year = {2026}
}