中文

深度强化学习的异步方法

机器学习 2016-06-17 v2

摘要

我们提出了一种概念上简单且轻量的深度强化学习框架,该框架使用异步梯度下降来优化深度神经网络控制器。我们给出了四种标准强化学习算法的异步变体,并表明并行 actor-learners 对训练具有稳定作用,使得这四种方法均能成功训练神经网络控制器。性能最佳的方法——actor-critic 的异步变体——在 Atari 领域超越了当前最先进水平,同时仅在单块多核 CPU 而非 GPU 上以一半的时间进行训练。此外,我们展示了异步 actor-critic 在多种连续运动控制问题上,以及在使用视觉输入导航随机 3D 迷宫的新任务上均取得成功。

关键词

引用

@article{arxiv.1602.01783,
  title  = {Asynchronous Methods for Deep Reinforcement Learning},
  author = {Volodymyr Mnih and Adrià Puigdomènech Badia and Mehdi Mirza and Alex Graves and Timothy P. Lillicrap and Tim Harley and David Silver and Koray Kavukcuoglu},
  journal= {arXiv preprint arXiv:1602.01783},
  year   = {2016}
}