深度强化学习的高效并行方法
机器学习
2017-05-17 v2
摘要
我们提出了一种用于深度强化学习算法高效并行化的新颖框架,使这些算法能够在单台机器上从多个执行器(actor)学习。该框架与算法无关,可应用于同策略、异策略、基于价值和基于策略梯度的算法。鉴于其固有的并行性,该框架可在 GPU 上高效实现,允许使用强大模型的同时显著减少训练时间。我们通过在 GPU 上实现优势执行者-评论者(advantage actor-critic)算法,使用同策略经验并采用同步更新,证明了我们框架的有效性。我们的算法在仅训练几小时后就在 Atari 领域达到了最先进的性能。因此,我们的框架为在要求苛刻的问题领域上进行更快的实验打开了大门。我们的实现是开源的,已在 https://github.com/alfredvc/paac 公开。
引用
@article{arxiv.1705.04862,
title = {Efficient Parallel Methods for Deep Reinforcement Learning},
author = {Alfredo V. Clemente and Humberto N. Castejón and Arjun Chandra},
journal= {arXiv preprint arXiv:1705.04862},
year = {2017}
}