面向策略梯度方法的随机递归动量法
机器学习
2020-03-10 v1 机器学习
摘要
在本文中,我们提出一种名为STORM-PG(面向策略梯度的随机递归动量法,STOchastic Recursive Momentum for Policy Gradient)的新算法,该算法以指数移动平均方式运行SARAH型随机递归方差缩减策略梯度。STORM-PG具有可证明的尖锐样本复杂度界,与已知最优的策略梯度算法收敛速率相匹配。同时,STORM-PG避免了在可比的方差缩减策略梯度方法中持续存在的大批量与小批量之间的交替,从而显著简化了参数调优。数值实验表明了我们的算法相对于对比策略梯度算法的优越性。
引用
@article{arxiv.2003.04302,
title = {Stochastic Recursive Momentum for Policy Gradient Methods},
author = {Huizhuo Yuan and Xiangru Lian and Ji Liu and Yuren Zhou},
journal= {arXiv preprint arXiv:2003.04302},
year = {2020}
}