优先经验回放
机器学习
2016-02-26 v4
摘要
经验回放使在线强化学习智能体能够记忆并重用过去的经验。在先前的工作中,经验转换是从回放存储器中均匀采样的。然而,这种方法只是以最初经历它们的相同频率来回放转换,而不管其重要性。在本文中,我们开发了一个优先化经验的框架,以便更频繁地回放重要的转换,从而更高效地学习。我们将优先经验回放应用于 Deep Q-Networks (DQN),这是一种在许多 Atari 游戏中达到人类水平性能的强化学习算法。带有优先经验回放的 DQN 达到了新的 SOTA,在 49 款游戏中的 41 款上优于采用均匀回放的 DQN。
引用
@article{arxiv.1511.05952,
title = {Prioritized Experience Replay},
author = {Tom Schaul and John Quan and Ioannis Antonoglou and David Silver},
journal= {arXiv preprint arXiv:1511.05952},
year = {2016}
}
备注
Published at ICLR 2016