中文

基于大规模深度强化学习的 Dota 2

机器学习 2021-03-10 v1 机器学习

摘要

2019年4月13日,OpenAI Five 成为首个在电子竞技游戏中击败世界冠军的 AI 系统。Dota 2 游戏为 AI 系统带来了新的挑战,例如长时间跨度、不完全信息以及复杂连续的 state-action 空间,这些挑战对于更强大的 AI 系统将变得日益关键。OpenAI Five 利用了现有的强化学习技术,并扩展至每2秒从约200万帧的批次中学习。我们开发了一个分布式训练系统和用于持续训练的工具,使我们能够训练 OpenAI Five 长达10个月。通过击败 Dota 2 世界冠军(Team OG),OpenAI Five 证明了自博弈强化学习能够在困难任务上取得超越人类的表现。

关键词

引用

@article{arxiv.1912.06680,
  title  = {Dota 2 with Large Scale Deep Reinforcement Learning},
  author = {OpenAI and : and Christopher Berner and Greg Brockman and Brooke Chan and Vicki Cheung and Przemysław Dębiak and Christy Dennison and David Farhi and Quirin Fischer and Shariq Hashme and Chris Hesse and Rafal Józefowicz and Scott Gray and Catherine Olsson and Jakub Pachocki and Michael Petrov and Henrique P. d. O. Pinto and Jonathan Raiman and Tim Salimans and Jeremy Schlatter and Jonas Schneider and Szymon Sidor and Ilya Sutskever and Jie Tang and Filip Wolski and Susan Zhang},
  journal= {arXiv preprint arXiv:1912.06680},
  year   = {2021}
}