Q-learning 的加速目标更新
机器学习
2019-05-14 v2 最优化与控制
机器学习
摘要
本文研究 Q-learning 算法中的加速方法。我们通过引入 Q 函数的历史迭代值,提出了一种加速目标更新方案。该思想在概念上受到优化理论中基于动量的加速方法的启发。我们建立了所提加速算法收敛的条件。这些算法使用强化学习中普遍采用的测试问题进行了验证,包括 FrozenLake 网格世界游戏、来自 Deepmind Control Suite 的两个离散时间 LQR 问题,以及 Atari 2600 游戏。仿真结果表明,与原始 Q-learning 算法相比,所提加速算法能够改善收敛性能。
引用
@article{arxiv.1905.02841,
title = {Accelerated Target Updates for Q-learning},
author = {Bowen Weng and Huaqing Xiong and Wei Zhang},
journal= {arXiv preprint arXiv:1905.02841},
year = {2019}
}
备注
We need further adjustment of some parts of the papaer