中文

随机方差缩减策略梯度的改进收敛性分析

机器学习 2019-05-30 v1 人工智能 最优化与控制 机器学习

摘要

我们重新审视Papini等人(2018)提出的用于强化学习的随机方差缩减策略梯度(SVRPG)方法。我们提供了SVRPG的改进收敛性分析,并表明它能在O(1/ϵ5/3)O(1/\epsilon^{5/3})条轨迹内找到性能函数的ϵ\epsilon-近似驻点。该样本复杂度相较最佳已知结果O(1/ϵ2)O(1/\epsilon^2)提升了O(1/ϵ1/3)O(1/\epsilon^{1/3})倍。我们分析的核心在于:(i)重要性采样权重方差的更紧上界,我们证明该方差可由不同策略间的参数距离控制;以及(ii)对周期长度与批量大小参数的细粒度分析,从而显著减少SVRPG每次迭代所需的轨迹数。我们还通过实验在强化学习基准任务上验证了关于批量大小的理论论断的有效性。

关键词

引用

@article{arxiv.1905.12615,
  title  = {An Improved Convergence Analysis of Stochastic Variance-Reduced Policy Gradient},
  author = {Pan Xu and Felicia Gao and Quanquan Gu},
  journal= {arXiv preprint arXiv:1905.12615},
  year   = {2019}
}

备注

10 pages, 2 figures, 1 table. To appear in the proceedings of the 35th International Conference on Uncertainty in Artificial Intelligence