Bregman 梯度策略优化
机器学习
2022-03-17 v3 机器人学
最优化与控制
摘要
在本文中,我们基于 Bregman 散度与动量技术设计了一种新颖的强化学习 Bregman 梯度策略优化框架。具体而言,我们提出了一种基于基本动量技术与镜像下降迭代的 Bregman 梯度策略优化(BGPO)算法。同时,我们进一步提出了一种基于方差缩减技术的加速 Bregman 梯度策略优化(VR-BGPO)算法。此外,我们在非凸设定下为所提 Bregman 梯度策略优化提供了收敛分析框架。我们证明,BGPO 在每次迭代仅需一条轨迹的条件下,达到寻找 -平稳策略的样本复杂度为 ;而 VR-BGPO 达到了已知最优的样本复杂度 ,其每次迭代同样仅需一条轨迹。特别地,通过使用不同的 Bregman 散度,我们的 BGPO 框架统一了诸多现有策略优化算法,例如现有的(方差缩减)策略梯度算法如自然策略梯度算法。在多个强化学习任务上的广泛实验结果证明了我们新算法的有效性。
引用
@article{arxiv.2106.12112,
title = {Bregman Gradient Policy Optimization},
author = {Feihu Huang and Shangqian Gao and Heng Huang},
journal= {arXiv preprint arXiv:2106.12112},
year = {2022}
}
备注
Published in ICLR 2022