解构化群相对政策优化:其政策梯度是 U 统计量
机器学习
2026-03-24 v3 机器学习
摘要
群相对政策优化(GRPO),作为 DeepSeekMath 和 DeepSeek-R1 的核心方法ological 组件,已成为扩大语言模型推理能力的基石。尽管其广泛采用和后续作品的不断涌现,GRPO 的理论属性仍受到较少关注。本文通过经典 U 统计量的视角,为理解 GRPO 提供了一个统一框架。我们展示了 GRPO 政策梯度本质上是一个 U 统计量,这使我们能够表征其均方误差(MSE)、推导其有限样本误差界以及其学习政策的次优间隙的渐近分布。我们的发现表明,GRPO 渐近等效于一个拥有量化其学习政策每个训练迭代中优劣价值函数的 oracle 政策梯度算法——在广泛的政策梯度算法类别中实现渐近最优性能。此外,我们建立了一个通用的缩放法则,为选择最佳群大小提供原则性指导。实证实验进一步验证了我们的理论发现,表明最佳群大小是通用的,并验证了 GRPO 的 oracle 属性。
引用
@article{arxiv.2603.01162,
title = {Demystifying Group Relative Policy Optimization: Its Policy Gradient is a U-Statistic},
author = {Hongyi Zhou and Kai Ye and Erhan Xu and Jin Zhu and Ying Yang and Shijin Gong and Chengchun Shi},
journal= {arXiv preprint arXiv:2603.01162},
year = {2026}
}
备注
5 pages, 53 figures