中文

基于动量的加速Q学习

系统与控制 2019-10-28 v1 系统与控制

摘要

本文研究Q学习的加速算法。我们通过引入Q函数的历史迭代提出一种加速方案。该思想在概念上受优化理论中基于动量的加速方法启发。在有限状态-动作空间设定下,所提加速Q学习算法可证明以 O(1/T)\mathcal{O}(1/\sqrt{T}) 的速率收敛至全局最优。虽然与现有的Speedy Q-learning(SpeedyQ)算法具有相当的理论收敛速率,我们通过FrozenLake网格世界游戏数值展示所提算法优于SpeedyQ。此外,我们将该加速方案推广到连续状态-动作空间情形,此时Q函数的函数近似是必要的。在此情形下,算法使用强化学习中常用测试问题验证,包括来自Deepmind Control Suite的两个离散时间线性二次调节(LQR)问题以及Atari 2600游戏。仿真结果表明,所提加速算法相比原始Q学习算法可改善收敛性能。

关键词

引用

@article{arxiv.1910.11673,
  title  = {Momentum-based Accelerated Q-learning},
  author = {Bowen Weng and Lin Zhao and Huaqing Xiong and Wei Zhang},
  journal= {arXiv preprint arXiv:1910.11673},
  year   = {2019}
}

备注

Submitted to American Control Conference (ACC) 2020. arXiv admin note: text overlap with arXiv:1905.02841