中文

星际争霸中基于深度强化学习的宏观动作选择

人工智能 2019-10-15 v3

摘要

星际争霸(SC)是最受欢迎且最成功的即时战略(RTS)游戏之一。近年来,由于其巨大的状态空间、部分可观测信息、多智能体协作等,SC 也被广泛接受为 AI 研究的一个具挑战性的测试平台。在年度 AIIDE 和 CIG 竞赛的助力下,越来越多 SC bot 被提出并持续改进。然而,顶级 bot 与职业人类玩家之间仍存在巨大差距。一个关键原因是当前 SC bot 主要依赖预定义规则在游戏中选宏观动作。这些规则可扩展性不足且效率不高,难以应对游戏中巨大且部分可观测的状态空间。本文中,我们提出一种深度强化学习(DRL)框架以改进宏观动作的选择。我们的框架基于 Ape-X DQN 与长短期记忆(LSTM)的结合。我们用此框架构建名为 LastOrder 的 bot。我们基于与 AIIDE 2017 星际争霸 AI 竞赛集中所有 bot 的训练对抗所做的评估显示,LastOrder 取得 83% 胜率,在总共 28 个参赛 bot 中胜过 26 个。

关键词

引用

@article{arxiv.1812.00336,
  title  = {Macro action selection with deep reinforcement learning in StarCraft},
  author = {Sijia Xu and Hongyu Kuang and Zhi Zhuang and Renjie Hu and Yang Liu and Huyang Sun},
  journal= {arXiv preprint arXiv:1812.00336},
  year   = {2019}
}