中文

为何GRPO需要归一化:基于自适应梯度的局部曲率视角

机器学习 2026-02-02 v1

摘要

强化学习(RL)已成为语言模型推理的关键驱动力。在RL算法中,Group Relative Policy Optimization(GRPO)是事实上的标准方法,无需评论家即可通过 per-prompt 基线和方差归一化来实现。然而,归一化为何以及何时有助于仍不清晰。本文通过序列级策略梯度的局部曲率视角提供了解释:标准差归一化实现了自适应梯度。理论上,在温和条件下,GRPO相对于未归一化的REINFORCE具有严格的收敛速率提升,其收益由 across prompts and iterations 的平均 within-prompt reward standard deviation 所刻画。实证上,我们的分析在GSM8K和MATH基准中揭示了三个不同的训练阶段,这些阶段由特征正交性与奖励方差的相互作用所主导:(I)一个早期加速阶段,其中高方差和正交性有利于自适应缩放;(II)一个相对稳定的过渡阶段;(III)一个后期阶段,其中正交性的丧失限制了进一步的收益。总之,这些结果为GRPO中std归一化何时有帮助提供了原则性解释,并为更广泛地理解无评论家RL算法的设计提供了洞见。

关键词

引用

@article{arxiv.2601.23135,
  title  = {Why GRPO Needs Normalization: A Local-Curvature Perspective on Adaptive Gradients},
  author = {Cheng Ge and Caitlyn Heqi Yin and Hao Liang and Jiawei Zhang},
  journal= {arXiv preprint arXiv:2601.23135},
  year   = {2026}
}