策略梯度估计的随机方差缩减
机器学习
2018-03-30 v4 机器学习
摘要
策略梯度方法和深度学习的最新进展已证明了它们在复杂强化学习问题中的适用性。然而,从模拟中获得的性能梯度估计的方差往往过大,导致样本效率低下。在本文中,我们将随机方差缩减梯度下降(SVRG)应用于无模型策略梯度,以显著提高样本效率。SVRG 估计被整合到一个用于策略优化的信任域牛顿共轭梯度框架中。在几个 Mujoco 任务上,与机器人连续控制领域最先进的无模型策略梯度方法(如信任域策略优化 TRPO)相比,我们的方法实现了显著更优的性能。
引用
@article{arxiv.1710.06034,
title = {Stochastic Variance Reduction for Policy Gradient Estimation},
author = {Tianbing Xu and Qiang Liu and Jian Peng},
journal= {arXiv preprint arXiv:1710.06034},
year = {2018}
}
备注
7 pages, 3 figures