中文

StarCraft II:强化学习的新挑战

机器学习 2017-08-17 v1 人工智能

摘要

本文介绍了 SC2LE(StarCraft II 学习环境),一个基于 StarCraft II 游戏的强化学习环境。该领域为强化学习提出了一个新的重大挑战,代表了比以往大多数工作所考虑的更为困难的一类问题。它是一个多智能体交互的多智能体问题;由于地图部分可观测,存在不完全信息;它具有涉及数百个单位选择与控制的大型动作空间;它具有必须完全从原始输入特征平面中观测的大型状态空间;并且它具有延迟的信用分配,需要在数千步中制定长期策略。我们描述了 StarCraft II 领域的观测、动作和奖励规范,并提供了一个基于 Python 的开源接口用于与游戏引擎通信。除了主游戏地图外,我们还提供了一套专注于 StarCraft II 游戏不同元素的迷你游戏。对于主游戏地图,我们还提供了人类专家玩家游戏回放数据的配套数据集。我们给出了利用该数据训练神经网络以预测游戏结果和玩家动作的初始基线结果。最后,我们展示了规范深度强化学习智能体应用于 StarCraft II 领域的初始基线结果。在迷你游戏中,这些智能体学习达到了可与新手玩家相媲美的游戏水平。然而,在主游戏上训练时,这些智能体无法取得显著进展。因此,SC2LE 为探索深度强化学习算法和架构提供了一个全新且极具挑战性的环境。

关键词

引用

@article{arxiv.1708.04782,
  title  = {StarCraft II: A New Challenge for Reinforcement Learning},
  author = {Oriol Vinyals and Timo Ewalds and Sergey Bartunov and Petko Georgiev and Alexander Sasha Vezhnevets and Michelle Yeo and Alireza Makhzani and Heinrich Küttler and John Agapiou and Julian Schrittwieser and John Quan and Stephen Gaffney and Stig Petersen and Karen Simonyan and Tom Schaul and Hado van Hasselt and David Silver and Timothy Lillicrap and Kevin Calderone and Paul Keet and Anthony Brunasso and David Lawrence and Anders Ekermo and Jacob Repp and Rodney Tsing},
  journal= {arXiv preprint arXiv:1708.04782},
  year   = {2017}
}

备注

Collaboration between DeepMind & Blizzard. 20 pages, 9 figures, 2 tables