使用随机递归梯度降低深度Q-学习的方差
机器学习
2020-07-28 v1 机器学习
摘要
深度Q学习算法常因梯度估计方差过大而效果不佳,导致训练不稳定和采样效率低下。随机方差缩减梯度方法(如SVRG)已被用于降低估计方差(Zhao et al. 2019)。然而,由于强化学习在线生成实例的特性,直接将SVRG应用于深度Q学习面临锚点估计不准确的问题,这极大地限制了SVRG的潜力。为解决此问题并受递归梯度方差缩减算法SARAH(Nguyen et al. 2017)的启发,本文提出在深度Q学习中引入递归框架来更新随机梯度估计,实现了一种称为SRG-DQN的新算法。与基于SVRG的算法不同,SRG-DQN设计了随机梯度估计的递归更新。参数更新是沿着利用过去随机梯度信息累积的方向进行的,因此可以摆脱对作为锚点的全梯度估计的依赖。此外,SRG-DQN融合了Adam过程以进一步加速训练过程。理论分析以及在著名强化学习任务上的实验结果证明了所提出的SRG-DQN算法的效率和有效性。
引用
@article{arxiv.2007.12817,
title = {Variance Reduction for Deep Q-Learning using Stochastic Recursive Gradient},
author = {Haonan Jia and Xiao Zhang and Jun Xu and Wei Zeng and Hao Jiang and Xiaohui Yan and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2007.12817},
year = {2020}
}
备注
8 pages, 3 figures