中文

重塑大规模强化学习中集体策略梯度的策略多样性

机器学习 2026-03-04 v2 人工智能 机器人学

摘要

将强化学习扩展到数万个平行环境需要克服单个策略的有限探索能力。近期提出的基于集体的策略梯度方法通过采用多个策略来收集多样化样本,以促进探索。然而,仅拓宽探索空间并不总是提高学习能力,因为过度探索可能降低探索质量或损害训练稳定性。本文在理论上分析了策略间多样性对学习效率的影响,并提出 Coupled Policy Optimization 通过策略间的 KL 约束来调节多样性。所提方法实现了有效的探索,在多个任务中尤其是挑战性的机械手操作任务上,相较于 SAPG、PBT 和 PPO 等强基线在样本效率和最终性能方面均表现出色。此外,对训练期间策略多样性和有效样本量的分析揭示了跟随者策略自然地围绕领袖策略分布,表现出结构化且高效的探索行为的涌现。我们的结果表明,在适当的调控下,多样化的探索是实现集体策略梥方法学习稳定且高效所必需的。项目页面可访问于 https://naoki04.github.io/paper-cpo/。

关键词

引用

@article{arxiv.2603.01741,
  title  = {Rethinking Policy Diversity in Ensemble Policy Gradient in Large-Scale Reinforcement Learning},
  author = {Naoki Shitanda and Motoki Omura and Tatsuya Harada and Takayuki Osa},
  journal= {arXiv preprint arXiv:2603.01741},
  year   = {2026}
}

备注

In ICLR 2026. Website at https://naoki04.github.io/paper-cpo/