中文

Q-learning 的加速目标更新

机器学习 2019-05-14 v2 最优化与控制 机器学习

摘要

本文研究 Q-learning 算法中的加速方法。我们通过引入 Q 函数的历史迭代值,提出了一种加速目标更新方案。该思想在概念上受到优化理论中基于动量的加速方法的启发。我们建立了所提加速算法收敛的条件。这些算法使用强化学习中普遍采用的测试问题进行了验证,包括 FrozenLake 网格世界游戏、来自 Deepmind Control Suite 的两个离散时间 LQR 问题,以及 Atari 2600 游戏。仿真结果表明,与原始 Q-learning 算法相比,所提加速算法能够改善收敛性能。

关键词

引用

@article{arxiv.1905.02841,
  title  = {Accelerated Target Updates for Q-learning},
  author = {Bowen Weng and Huaqing Xiong and Wei Zhang},
  journal= {arXiv preprint arXiv:1905.02841},
  year   = {2019}
}

备注

We need further adjustment of some parts of the papaer