分布式深度强化学习:21分钟学会玩Atari游戏
人工智能
2018-04-10 v2
摘要
我们提出了一项关于分布式深度强化学习(DDRL)的研究,聚焦于被称为批量异步优势Actor-Critic(BA3C)的先进深度强化学习算法的可扩展性。我们展示了使用Adam优化算法且批大小高达2048,是进行大规模机器学习计算的可行选择。这一点,结合仔细重新审视优化器的超参数、在节点层面使用同步训练(同时保持算法局部的单节点部分为异步)以及最小化模型的内存占用,使我们能够在多达64个CPU节点上实现线性扩展。这对应于在768个CPU核上21分钟的训练时间,而使用单节点24核的基线单节点实现则需要10小时。
引用
@article{arxiv.1801.02852,
title = {Distributed Deep Reinforcement Learning: Learn how to play Atari games in 21 minutes},
author = {Igor Adamski and Robert Adamski and Tomasz Grel and Adam Jędrych and Kamil Kaczmarek and Henryk Michalewski},
journal= {arXiv preprint arXiv:1801.02852},
year = {2018}
}