中文

策略梯度方法对(近似)局部最优策略的全局收敛性

最优化与控制 2020-06-30 v3 机器学习 系统与控制 系统与控制 统计理论 统计理论

摘要

策略梯度(PG)方法是视频游戏、自动驾驶和机器人等许多应用中广泛使用的强化学习方法。尽管取得了经验上的成功,文献中仍缺乏对 PG 方法全局收敛性的严格理解。在本工作中,我们从非凸优化视角出发弥补这一空白。具体而言,我们针对无限时域问题提出了一种 PG 方法的新变体,该方法使用随机 rollout 步长对策略梯度进行蒙特卡洛估计。该方法进而给出了方差有界的策略梯度的无偏估计,使得非凸优化的工具可用于建立全局收敛性。采用这一视角,我们首先恢复了文献中收敛到平稳点策略的带速率结果。更有趣的是,受非凸优化进展的启发,我们通过引入周期性放大的步长来修改所提出的 PG 方法。在关于奖励和策略参数化的温和假设下,所修改后的算法被证明能够逃离鞍点。在进一步的严格鞍点假设下,该结果建立了对底层问题本质局部最优策略的收敛性,从而弥合了现有文献中 PG 方法收敛性的空白。随后给出了倒立摆上的实验结果以佐证我们的理论,即通过对奖励函数稍作重塑以满足我们的假设,可以避免不利的鞍点并获得更好的极限点。引人深思的是,这一经验发现从非凸优化视角证明了奖励重塑的益处。

关键词

引用

@article{arxiv.1906.08383,
  title  = {Global Convergence of Policy Gradient Methods to (Almost) Locally Optimal Policies},
  author = {Kaiqing Zhang and Alec Koppel and Hao Zhu and Tamer Başar},
  journal= {arXiv preprint arXiv:1906.08383},
  year   = {2020}
}

备注

Initially submitted in Jan. 2019. Accepted to SIAM Journal on Control and Optimization (SICON)