中文

带自适应与动量重启的 Q-learning 梯度下降分析

最优化与控制 2020-07-16 v1 机器学习

摘要

现有 Q-learning 的收敛性分析大多聚焦于原始随机梯度下降(SGD)类型的更新。尽管自适应矩估计(Adam)已广泛用于实际 Q-learning 算法,但此类更新尚未有任何收敛性保证。本文中,我们首先刻画 Q-AMSGrad 的收敛速率,该算法为采用 AMSGrad 更新(一种常用于理论分析的 Adam 替代方案)的 Q-learning 算法。为进一步提升性能,我们提出将动量重启方案引入 Q-AMSGrad,得到所谓的 Q-AMSGradR 算法。我们也建立了 Q-AMSGradR 的收敛速率。在线性二次调节器问题上的实验表明,所提两种 Q-learning 算法优于采用 SGD 更新的原始 Q-learning。这两种算法在一批 Atari 2600 游戏上也显著优于 DQN 学习方法。

关键词

引用

@article{arxiv.2007.07422,
  title  = {Analysis of Q-learning with Adaptation and Momentum Restart for Gradient Descent},
  author = {Bowen Weng and Huaqing Xiong and Yingbin Liang and Wei Zhang},
  journal= {arXiv preprint arXiv:2007.07422},
  year   = {2020}
}

备注

This paper extends the work presented at the 2020 International Joint Conferences on Artificial Intelligence with supplementary materials