中文

分布式优先经验回放

机器学习 2018-03-05 v1

摘要

我们提出了一种大规模的深度强化学习分布式架构,使智能体能够比以往可能地从数量级更多的数据中有效学习。该算法将行动与学习解耦:行动者根据自身的环境实例,依据共享神经网络选择动作,并将所得经验累积于共享经验回放记忆中;学习者回放经验样本并更新神经网络。该架构依赖于优先经验回放(prioritized experience replay),以仅关注行动者生成的最显著数据。我们的架构在街机学习环境(Arcade Learning Environment)上大幅改进了当前最优水平,在极短的真实训练时间内取得了更好的最终性能。

关键词

引用

@article{arxiv.1803.00933,
  title  = {Distributed Prioritized Experience Replay},
  author = {Dan Horgan and John Quan and David Budden and Gabriel Barth-Maron and Matteo Hessel and Hado van Hasselt and David Silver},
  journal= {arXiv preprint arXiv:1803.00933},
  year   = {2018}
}

备注

Accepted to International Conference on Learning Representations 2018