中文

AlphaStar Unplugged:大规模离线强化学习

机器学习 2023-08-08 v1 人工智能

摘要

StarCraft II 是最具挑战性的模拟强化学习环境之一;它是部分可观测、随机、多智能体的,且掌握 StarCraft II 需要在长时间尺度上进行战略规划并伴随实时底层执行。它还具有活跃的职业竞技场景。StarCraft II 因其挑战性以及暴雪发布了由人类玩家进行的数百万局游戏的大规模数据集,而 uniquely suited 于推进离线 RL 算法。本文利用该数据集建立了一个称为 AlphaStar Unplugged 的基准,引入了前所未有的离线强化学习挑战。我们定义了一个数据集(暴雪发布的子集)、标准化机器学习方法 API 的工具以及一个评估协议。我们还提出了基线智能体,包括行为克隆、actor-critic 与 MuZero 的离线变体。我们仅使用离线数据改进了智能体的最优水平,并实现了对先前发布的 AlphaStar 行为克隆智能体 90% 的胜率。

关键词

引用

@article{arxiv.2308.03526,
  title  = {AlphaStar Unplugged: Large-Scale Offline Reinforcement Learning},
  author = {Michaël Mathieu and Sherjil Ozair and Srivatsan Srinivasan and Caglar Gulcehre and Shangtong Zhang and Ray Jiang and Tom Le Paine and Richard Powell and Konrad Żołna and Julian Schrittwieser and David Choi and Petko Georgiev and Daniel Toyama and Aja Huang and Roman Ring and Igor Babuschkin and Timo Ewalds and Mahyar Bordbar and Sarah Henderson and Sergio Gómez Colmenarejo and Aäron van den Oord and Wojciech Marian Czarnecki and Nando de Freitas and Oriol Vinyals},
  journal= {arXiv preprint arXiv:2308.03526},
  year   = {2023}
}

备注

32 pages, 13 figures, previous version published as a NeurIPS 2021 workshop: https://openreview.net/forum?id=Np8Pumfoty