SEED RL:基于加速中心推断的可扩展高效深度强化学习
机器学习
2020-02-12 v2 机器学习
摘要
我们提出了一种称为 SEED(可扩展、高效深度强化学习)的现代可扩展强化学习智能体。通过有效利用现代加速器,我们表明不仅可能以每秒数百万帧的速度训练,而且与当前方法相比降低了实验成本。我们通过一个具有中心化推断和优化通信层的简单架构实现了这一点。SEED 采用了两种最先进的分布式算法,IMPALA/V-trace(策略梯度)和 R2D2(Q-learning),并在 Atari-57、DeepMind Lab 和 Google Research Football 上进行了评估。我们改进了 Football 上的最优水平,并能够在 wall-time 上以三倍速度达到 Atari-57 上的最优水平。对于我们考虑的场景,运行实验的成本降低了 40% 到 80%。实现及实验已开源,以便复现结果并尝试新想法。
引用
@article{arxiv.1910.06591,
title = {SEED RL: Scalable and Efficient Deep-RL with Accelerated Central Inference},
author = {Lasse Espeholt and Raphaël Marinier and Piotr Stanczyk and Ke Wang and Marcin Michalski},
journal= {arXiv preprint arXiv:1910.06591},
year = {2020}
}
备注
New version that includes changes made during the ICLR 2020 review process (https://openreview.net/forum?id=rkgvXlrKwH)