中文

优先经验回放

机器学习 2016-02-26 v4

摘要

经验回放使在线强化学习智能体能够记忆并重用过去的经验。在先前的工作中,经验转换是从回放存储器中均匀采样的。然而,这种方法只是以最初经历它们的相同频率来回放转换,而不管其重要性。在本文中,我们开发了一个优先化经验的框架,以便更频繁地回放重要的转换,从而更高效地学习。我们将优先经验回放应用于 Deep Q-Networks (DQN),这是一种在许多 Atari 游戏中达到人类水平性能的强化学习算法。带有优先经验回放的 DQN 达到了新的 SOTA,在 49 款游戏中的 41 款上优于采用均匀回放的 DQN。

关键词

引用

@article{arxiv.1511.05952,
  title  = {Prioritized Experience Replay},
  author = {Tom Schaul and John Quan and Ioannis Antonoglou and David Silver},
  journal= {arXiv preprint arXiv:1511.05952},
  year   = {2016}
}

备注

Published at ICLR 2016