中文

GEPO:用于稳定异构强化学习的群组期望策略优化

机器学习 2026-01-30 v9 人工智能

摘要

随着单中心计算方法受到能源约束,去中心化训练变得至关重要。然而,传统的强化学习(RL)方法对于增强大型模型的后训练至关重要,却无法适应去中心化分布式训练,因为参数学习与 rollout 抽样之间存在紧密耦合。为此,我们提出了 HeteroRL,一种异构 RL 架构,通过解耦这些过程,实现了通过互联网连接的分布在不同地理位置的节点之间的稳定训练。核心组件是群组期望策略优化(GEPO),这是一种异步 RL 算法,能够抵御由网络延迟或计算资源异构性导致的延迟。我们的研究表明,高延迟显著增加 KL 散度,导致重要性权重的方差增大和训练不稳定。GEPO 通过使用群组期望加权来指数级降低重要性权重的方差,具有理论保证。实验表明,GEPO 实现了卓越的稳定性——仅有 3% 的性能下降,从在线到 1800 秒延迟;在 GSPO(1.8 vs 12.0)中将最佳与最后的差距缩小 85%,同时取得最高分数,凸显了其在去中心化、资源异构环境中的有效性。

关键词

引用

@article{arxiv.2508.17850,
  title  = {GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning},
  author = {Han Zhang and Ruibin Zheng and Zexuan Yi and Zhuo Zhang and Hanyang Peng and Hui Wang and Zike Yuan and Cai Ke and Shiwei Chen and Jiacheng Yang and Yangning Li and Xiang Li and Jiangyue Yan and Yaoqi Liu and Liwen Jing and Jiayin Qi and Ruifeng Xu and Binxing Fang and Yue Yu},
  journal= {arXiv preprint arXiv:2508.17850},
  year   = {2026}
}