中文

基于双Q学习的深度强化学习

机器学习 2015-12-10 v3

摘要

流行的Q-learning算法在某些条件下已知会高估动作价值。此前未知的是,在实践中此类高估是否常见、是否会损害性能、以及是否通常可被防止。在本文中,我们肯定地回答了所有这些问题。具体而言,我们首先展示了近期的DQN算法(其将Q-learning与深度神经网络结合)在Atari 2600领域的某些游戏中遭受显著的高估。然后我们展示,在表格设置中引入的双Q学习(Double Q-learning)算法背后的思想可推广至大规模函数近似。我们提出了对DQN算法的一种特定适配,并表明所得算法不仅如假设那样减少了观察到的高估,而且还在多个游戏上带来了好得多的性能。

关键词

引用

@article{arxiv.1509.06461,
  title  = {Deep Reinforcement Learning with Double Q-learning},
  author = {Hado van Hasselt and Arthur Guez and David Silver},
  journal= {arXiv preprint arXiv:1509.06461},
  year   = {2015}
}

备注

AAAI 2016