中文

平衡聚合:理解与修正 GRPO 中的聚合偏差

机器学习 2026-05-07 v1 人工智能 计算与语言

摘要

基于可验证奖励的强化学习(RLVR)已成为提高大语言模型推理与代码生成中枢方法,GRPO 风格训练因其简单性与有效性广泛采用。然而,一个重要设计选择仍未得到充分探讨:在每个抽样组内,token 级别的 policy gradient 项如何被聚合。标准 GRPO 使用序列聚合,而近期研究则主张使用 token 聚合作为更好的替代方案。我们表明,这两种规则会引发不同的优化偏差:token 聚合引入了符号-长度耦合,而序列聚合则通过序列级均等加权隐式地对较长响应进行降权。为解决这一张力,我们提出了平衡聚合(Balanced Aggregation, BA),这是一种即插即用的替换方案,分别计算正负子集中 token 级别的均值,然后使用序列计数加权将其组合。在 Qwen2.5-Math-7B 和 Qwen3-1.7B 上进行的 DAPO-17k 和 Polaris 实验显示,BA 在六个推理与编码基准测试上均一致地提高了训练稳定性和最终性能。我们的分析进一步表明,token 聚合与序列聚合的相对有效性主要由响应长度变化和正负长度差异所主导,突显聚合作为 GRPO 风格 RLVR 中的关键设计维度。

关键词

引用

@article{arxiv.2605.04077,
  title  = {Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO},
  author = {Zhiyuan Zeng and Jiameng Huang and Zhangyue Yin and Jiashuo Liu and Ziniu Li and Bingrui Li and Yuhao Wu and Yining Zheng and Ge Zhang and Wenhao Huang and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2605.04077},
  year   = {2026}
}