一条环绕万物:通过动态幂均几何统一基于群的强化学习
计算与语言
2026-02-02 v1
摘要
基于群的强化学习从 GRPO 的算术均值发展而来,后续发展为 GMPO 的几何均值。虽然 GMPO 通过约束保守目标来提高稳定性,但它与 GRPO 一样存在根本局限:依赖固定的聚合几何,忽略每条轨迹的动态性和异构性。在本工作中,我们在 Power-Mean Policy Optimization(PMPO)框架下统一这些方法,这是一种通过幂均几何指数 p 参数化聚合几何的通用框架。在此框架下,恢复 GRPO 和 GMPO 作为特殊情况。理论上,我们展示,调整 p 可调节梯度更新的浓度,从而有效地根据优势贡献重新加权 token。在确定 p 的自适应方式方面,我们引入一种 Clip-aware 有效样本数(ESS)机制。具体而言,我们提出一种将轨迹裁剪比例映射到目标 ESS 的确定性规则,然后求解特定的 p 以将由轨迹引起的 ESS 与该目标相匹配。这使 PMPO 能够在可靠轨迹上动态转换到激进的算术均值,在不稳定轨迹上转换到保守的几何均值。在多个数学推理基准测试中实验表明,PMPO 在强基准方法上取得优异性能。
引用
@article{arxiv.2601.22521,
title = {One Ring to Rule Them All: Unifying Group-Based RL via Dynamic Power-Mean Geometry},
author = {Weisong Zhao and Tong Wang and Zichang Tan and Te Yang and Siran Peng and Haoyuan Zhang and Tianshuo Zhang and Haichao Shi and Meng Meng and Yang Yang and Xiangyu Zhu and Zhen Lei and Xiao-Yu Zhang and Xu Zhou},
journal= {arXiv preprint arXiv:2601.22521},
year = {2026}
}
备注
17 pages, 3 figures