深度Q学习的随机方差缩减
机器学习
2019-05-21 v1 机器学习
摘要
深度强化学习的最新进展已在多种现实应用中达到人类水平表现。然而,当前算法仍受梯度估计方差过大之苦,导致训练不稳定与样本效率低。在本文中,我们提出一种利用随机方差缩减梯度(SVRG)技术的创新优化策略。在Atari领域的广泛实验中,我们的方法在20个游戏中的18个上优于深度Q学习基线。
引用
@article{arxiv.1905.08152,
title = {Stochastic Variance Reduction for Deep Q-learning},
author = {Wei-Ye Zhao and Xi-Ya Guan and Yang Liu and Xiaoming Zhao and Jian Peng},
journal= {arXiv preprint arXiv:1905.08152},
year = {2019}
}
备注
this is the full paper version, its extended abstract has been published