中文

Bregman 梯度策略优化

机器学习 2022-03-17 v3 机器人学 最优化与控制

摘要

在本文中,我们基于 Bregman 散度与动量技术设计了一种新颖的强化学习 Bregman 梯度策略优化框架。具体而言,我们提出了一种基于基本动量技术与镜像下降迭代的 Bregman 梯度策略优化(BGPO)算法。同时,我们进一步提出了一种基于方差缩减技术的加速 Bregman 梯度策略优化(VR-BGPO)算法。此外,我们在非凸设定下为所提 Bregman 梯度策略优化提供了收敛分析框架。我们证明,BGPO 在每次迭代仅需一条轨迹的条件下,达到寻找 ϵ\epsilon-平稳策略的样本复杂度为 O(ϵ4)O(\epsilon^{-4});而 VR-BGPO 达到了已知最优的样本复杂度 O(ϵ3)O(\epsilon^{-3}),其每次迭代同样仅需一条轨迹。特别地,通过使用不同的 Bregman 散度,我们的 BGPO 框架统一了诸多现有策略优化算法,例如现有的(方差缩减)策略梯度算法如自然策略梯度算法。在多个强化学习任务上的广泛实验结果证明了我们新算法的有效性。

关键词

引用

@article{arxiv.2106.12112,
  title  = {Bregman Gradient Policy Optimization},
  author = {Feihu Huang and Shangqian Gao and Heng Huang},
  journal= {arXiv preprint arXiv:2106.12112},
  year   = {2022}
}

备注

Published in ICLR 2022