中文

几何均值策略优化

计算与语言 2025-10-21 v3

摘要

组Relative策略优化(GRPO)通过优化标记级奖励的算术平均值,显著提升了大型语言模型的推理能力。然而,GRPO在面对带有异常重要性加权奖励的标记时,观察到策略更新不稳定,这些异常表现为训练期间的极端重要性抽样比率。在本研究中,我们提出了几何均值策略优化(GMPO),旨在通过抑制标记奖励中的异常值来提高GRPO的稳定性。GMPO不同于GRPO优化算术平均值,转而最大化标记级奖励的几何平均值,这在本质上对异常值更不敏感,并维持更稳定的重要性抽样比率范围。GMPO即插即用——只需将GRPO的算术平均值替换为标记级奖励的几何平均值,后者在本质上对异常值更不敏感。GMPO的理论合理性分析揭示,GMPO与GRPO都是加权的策略梯度形式,而前者享有更稳定的权重,从而从根本上利于策略优化与性能。在多个数学推理基准测试中,GMPO-7B将GRPO的平均Pass@1提高了最高可达4.1%,超越众多最先进的方法。代码可在 https://github.com/callsys/GMPO 获取。

关键词

引用

@article{arxiv.2507.20673,
  title  = {Geometric-Mean Policy Optimization},
  author = {Yuzhong Zhao and Yue Liu and Junpeng Liu and Jingye Chen and Xun Wu and Yaru Hao and Tengchao Lv and Shaohan Huang and Lei Cui and Qixiang Ye and Fang Wan and Furu Wei},
  journal= {arXiv preprint arXiv:2507.20673},
  year   = {2025}
}

备注

Code is available at https://github.com/callsys/GMPO