具有递归方差缩减的采样高效策略梯度方法
机器学习
2021-08-03 v3 最优化与控制
机器学习
摘要
提高强化学习中的采样效率一直是一个长期的研究问题。在这项工作中,我们旨在降低现有策略梯度方法的采样复杂度。我们提出了一种称为 SRVR-PG 的新型策略梯度算法,该算法仅需 轮交互即可找到非凹性能函数 的 -近似驻点(即满足 的 )。该采样复杂度将现有随机方差缩减策略梯度算法的 结果提升了 倍。此外,我们还提出了一种带参数探索的 SRVR-PG 变体,该变体从先验概率分布中对初始策略参数进行探索。我们在强化学习的经典控制问题上进行了数值实验,以验证我们所提算法的性能。
引用
@article{arxiv.1909.08610,
title = {Sample Efficient Policy Gradient Methods with Recursive Variance Reduction},
author = {Pan Xu and Felicia Gao and Quanquan Gu},
journal= {arXiv preprint arXiv:1909.08610},
year = {2021}
}
备注
23 pages, 2 figures, 3 tables. In ICLR 2020