中文

应用于 PPO 和 RUDDER 的 actor-critic 方法收敛性证明

机器学习 2020-12-03 v1 人工智能 最优化与控制

摘要

我们在常用假设下证明了 actor-critic 强化学习算法的收敛性,该算法同时学习策略函数(actor)和值函数(critic)。两函数均可为任意复杂度的深度神经网络。我们的框架可证明著名的 Proximal Policy Optimization (PPO) 和近期提出的 RUDDER 的收敛性。对于收敛性证明,我们采用了双时间尺度随机逼近理论中的近期技术。我们的结果对使用片段样本且策略在学习中变得更贪婪的 actor-critic 方法有效。先前的收敛性证明假设线性函数逼近、不能处理片段样本,或未考虑策略变贪婪。后者相关,因为最优策略通常是确定性的。

关键词

引用

@article{arxiv.2012.01399,
  title  = {Convergence Proof for Actor-Critic Methods Applied to PPO and RUDDER},
  author = {Markus Holzleitner and Lukas Gruber and José Arjona-Medina and Johannes Brandstetter and Sepp Hochreiter},
  journal= {arXiv preprint arXiv:2012.01399},
  year   = {2020}
}

备注

20 pages