MC-GRPO:面向小批量 Rollout 的中位数中心化群相对政策优化
机器学习
2026-02-02 v1 人工智能
摘要
群相对政策优化方法通过为每个提示生成多个 rollout 并使用共享均值奖励基线对奖励进行标准化来训练语言模型。在 rollout 预算有限的情况下,准确率常常会下降。我们发现,共享基线中的噪声会导致优势符号翻转,即一些 rollout 接收错误的优势符号,从而使更新方向被反转。为此,我们提出了中位数中心化群相对政策优化(MC-GRPO),这是一种针对小批量训练的简单且有效的解决方案。我们的主要思想是将均值基线替换为中位数基线:中位数对异常奖励不那么敏感,这在小批量大小(G)下能有效缓解符号翻转问题。我们生成一个额外的 rollout 用于中位数参考(G+1),并使用组中位数计算优势。对于奇数大小的组,恰好有一个 completion 是中位数且获得零优势,我们从反向传播中排除该枢轴 rollout,以保持每个提示下的梯度贡献样本数为 G,保留标准 G-rollout 训练的核心更新成本。我们在各种 GRPO 家族方法以及广泛的模型和规模上,都能在小批量情境下显著提升训练的稳定性和最终准确率,将 G=2 与 G=8 之间的差距缩小至 1% 之内。代码已在 https://github.com/lotusroot-kim/MC-GRPO 上提供。
引用
@article{arxiv.2601.22582,
title = {MC-GRPO: Median-Centered Group Relative Policy Optimization for Small-Rollout Reinforcement Learning},
author = {Youngeun Kim},
journal= {arXiv preprint arXiv:2601.22582},
year = {2026}
}