基于GPU的异步优势演员-评论家强化学习
机器学习
2017-03-08 v3
摘要
我们介绍了异步优势演员-评论家 (A3C) 算法的混合 CPU/GPU 版本,该算法目前是各种游戏任务中强化学习的最先进方法。我们分析了其计算特性,并集中于对利用 GPU 计算能力至关重要的方面。我们引入了一种队列系统和动态调度策略,这可能也有助于其他异步算法。我们基于 TensorFlow 的混合 CPU/GPU 版 A3C 相比 CPU 实现取得了显著的加速;我们在 https://github.com/NVlabs/GA3C 将其公开供其他研究者使用。
引用
@article{arxiv.1611.06256,
title = {Reinforcement Learning through Asynchronous Advantage Actor-Critic on a GPU},
author = {Mohammad Babaeizadeh and Iuri Frosio and Stephen Tyree and Jason Clemons and Jan Kautz},
journal= {arXiv preprint arXiv:1611.06256},
year = {2017}
}