中文

一种用于强化学习的混合随机策略梯度算法

机器学习 2020-09-23 v2 最优化与控制

摘要

我们通过将无偏策略梯度估计器REINFORCE估计器与另一个有偏的、适用于策略优化的改进SARAH估计器相结合,提出了一种新颖的混合随机策略梯度估计器。该混合策略梯度估计器被证明是有偏的,但具有方差缩减特性。利用该估计器,我们开发了一种新的近端混合随机策略梯度算法(ProxHSPGA)来求解复合策略优化问题,该问题允许我们处理策略参数上的约束或正则化项。我们首先提出了一种单循环算法,然后引入了一种更实用的重启变体。我们证明了两种算法都能达到已知最优的轨迹复杂度O(ε3)\mathcal{O}\left(\varepsilon^{-3}\right)以取得复合问题的首次序平稳点,这优于非复合设定下现有的REINFORCE/GPOMDP的O(ε4)\mathcal{O}\left(\varepsilon^{-4}\right)和SVRPG的O(ε10/3)\mathcal{O}\left(\varepsilon^{-10/3}\right)。我们在强化学习中若干知名实例上评估了算法的性能。数值结果表明,我们的算法在这些实例上优于两种现有方法。此外,在某些问题上,复合设定相比非复合设定确实具有一些优势。

关键词

引用

@article{arxiv.2003.00430,
  title  = {A Hybrid Stochastic Policy Gradient Algorithm for Reinforcement Learning},
  author = {Nhan H. Pham and Lam M. Nguyen and Dzung T. Phan and Phuong Ha Nguyen and Marten van Dijk and Quoc Tran-Dinh},
  journal= {arXiv preprint arXiv:2003.00430},
  year   = {2020}
}

备注

Accepted for publication at the 23rd International Conference on Artificial Intelligence and Statistics (AISTATS 2020)