深度强化学习的异步方法
机器学习
2016-06-17 v2
摘要
我们提出了一种概念上简单且轻量的深度强化学习框架,该框架使用异步梯度下降来优化深度神经网络控制器。我们给出了四种标准强化学习算法的异步变体,并表明并行 actor-learners 对训练具有稳定作用,使得这四种方法均能成功训练神经网络控制器。性能最佳的方法——actor-critic 的异步变体——在 Atari 领域超越了当前最先进水平,同时仅在单块多核 CPU 而非 GPU 上以一半的时间进行训练。此外,我们展示了异步 actor-critic 在多种连续运动控制问题上,以及在使用视觉输入导航随机 3D 迷宫的新任务上均取得成功。
引用
@article{arxiv.1602.01783,
title = {Asynchronous Methods for Deep Reinforcement Learning},
author = {Volodymyr Mnih and Adrià Puigdomènech Badia and Mehdi Mirza and Alex Graves and Timothy P. Lillicrap and Tim Harley and David Silver and Koray Kavukcuoglu},
journal= {arXiv preprint arXiv:1602.01783},
year = {2016}
}