中文

基于GPU的异步优势演员-评论家强化学习

机器学习 2017-03-08 v3

摘要

我们介绍了异步优势演员-评论家 (A3C) 算法的混合 CPU/GPU 版本,该算法目前是各种游戏任务中强化学习的最先进方法。我们分析了其计算特性,并集中于对利用 GPU 计算能力至关重要的方面。我们引入了一种队列系统和动态调度策略,这可能也有助于其他异步算法。我们基于 TensorFlow 的混合 CPU/GPU 版 A3C 相比 CPU 实现取得了显著的加速;我们在 https://github.com/NVlabs/GA3C 将其公开供其他研究者使用。

关键词

引用

@article{arxiv.1611.06256,
  title  = {Reinforcement Learning through Asynchronous Advantage Actor-Critic on a GPU},
  author = {Mohammad Babaeizadeh and Iuri Frosio and Stephen Tyree and Jason Clemons and Jan Kautz},
  journal= {arXiv preprint arXiv:1611.06256},
  year   = {2017}
}