应用于 PPO 和 RUDDER 的 actor-critic 方法收敛性证明
机器学习
2020-12-03 v1 人工智能
最优化与控制
摘要
我们在常用假设下证明了 actor-critic 强化学习算法的收敛性,该算法同时学习策略函数(actor)和值函数(critic)。两函数均可为任意复杂度的深度神经网络。我们的框架可证明著名的 Proximal Policy Optimization (PPO) 和近期提出的 RUDDER 的收敛性。对于收敛性证明,我们采用了双时间尺度随机逼近理论中的近期技术。我们的结果对使用片段样本且策略在学习中变得更贪婪的 actor-critic 方法有效。先前的收敛性证明假设线性函数逼近、不能处理片段样本,或未考虑策略变贪婪。后者相关,因为最优策略通常是确定性的。
引用
@article{arxiv.2012.01399,
title = {Convergence Proof for Actor-Critic Methods Applied to PPO and RUDDER},
author = {Markus Holzleitner and Lukas Gruber and José Arjona-Medina and Johannes Brandstetter and Sepp Hochreiter},
journal= {arXiv preprint arXiv:2012.01399},
year = {2020}
}
备注
20 pages