基于双Q学习的深度强化学习
机器学习
2015-12-10 v3
摘要
流行的Q-learning算法在某些条件下已知会高估动作价值。此前未知的是,在实践中此类高估是否常见、是否会损害性能、以及是否通常可被防止。在本文中,我们肯定地回答了所有这些问题。具体而言,我们首先展示了近期的DQN算法(其将Q-learning与深度神经网络结合)在Atari 2600领域的某些游戏中遭受显著的高估。然后我们展示,在表格设置中引入的双Q学习(Double Q-learning)算法背后的思想可推广至大规模函数近似。我们提出了对DQN算法的一种特定适配,并表明所得算法不仅如假设那样减少了观察到的高估,而且还在多个游戏上带来了好得多的性能。
引用
@article{arxiv.1509.06461,
title = {Deep Reinforcement Learning with Double Q-learning},
author = {Hado van Hasselt and Arthur Guez and David Silver},
journal= {arXiv preprint arXiv:1509.06461},
year = {2015}
}
备注
AAAI 2016