中文

二值奖励下的 GRPO 梯度饥饿:为何组均中心化失败以及为何最简单的修复有效

机器学习 2026-05-11 v1

摘要

Group Relative Policy Optimization (GRPO) 是从可验证奖励中进行强化学习的标准算法,但其基于组均值的中心化优势在二值奖励下可能失败。其失败模式为梯度饥饿:当组内所有响应均正确或所有响应均错误时,中心化优势恰好为零,策略则无法获得学习信号。我们通过 Jensen 不等式证明,真实的退化率始终高于 i.i.d. 伯努利预测,并观察到在组大小为4时,使用 Qwen3.5-9B 在GSM8K 训练中出现0.69的退化率。随后我们表明,固定参考 Sign 优势 A=2r1A=2r-1 通过增加组中至少一个样本成功的概率来实现 pass@GG 失效下降。在完整GSM8K测试集上进行七次随机种子实验中,Sign 达到73.8%的准确率,而标准归一化组均 DrGRPO 在组大小为4时仅为28.4%,净增45.4分,p<0.0001p<0.0001。在Llama-3.1-8B和MATH-500迁移检查上,效果方向一致,虽在Llama-3.1-8B上为正但在MATH-500上欠力。在pass@kk 分析中,主要益处体现在搜索压缩而非大规模容量扩展,这与近期 RLVR 底峰观察结果相吻合。

关键词

引用

@article{arxiv.2605.07689,
  title  = {Gradient Starvation in Binary-Reward GRPO: Why Group-Mean Centering Fails and Why the Simplest Fix Works},
  author = {Wenhua Nie and Jianan Wu and Junlin Liu and Ziwei Li and Zheng Lin and Zhang Zijian and Yilong Fan and Haoran Zheng and Jyh-Shing Roger Jang},
  journal= {arXiv preprint arXiv:2605.07689},
  year   = {2026}
}