中文

具有递归方差缩减的采样高效策略梯度方法

机器学习 2021-08-03 v3 最优化与控制 机器学习

摘要

提高强化学习中的采样效率一直是一个长期的研究问题。在这项工作中,我们旨在降低现有策略梯度方法的采样复杂度。我们提出了一种称为 SRVR-PG 的新型策略梯度算法,该算法仅需 O(1/ϵ3/2)O(1/\epsilon^{3/2}) 轮交互即可找到非凹性能函数 J(θ)J(\boldsymbol{\theta})ϵ\epsilon-近似驻点(即满足 J(θ)22ϵ\|\nabla J(\boldsymbol{\theta})\|_2^2\leq\epsilonθ\boldsymbol{\theta})。该采样复杂度将现有随机方差缩减策略梯度算法的 O(1/ϵ5/3)O(1/\epsilon^{5/3}) 结果提升了 O(1/ϵ1/6)O(1/\epsilon^{1/6}) 倍。此外,我们还提出了一种带参数探索的 SRVR-PG 变体,该变体从先验概率分布中对初始策略参数进行探索。我们在强化学习的经典控制问题上进行了数值实验,以验证我们所提算法的性能。

关键词

引用

@article{arxiv.1909.08610,
  title  = {Sample Efficient Policy Gradient Methods with Recursive Variance Reduction},
  author = {Pan Xu and Felicia Gao and Quanquan Gu},
  journal= {arXiv preprint arXiv:1909.08610},
  year   = {2021}
}

备注

23 pages, 2 figures, 3 tables. In ICLR 2020