星际争霸中基于深度强化学习的宏观动作选择
人工智能
2019-10-15 v3
摘要
星际争霸(SC)是最受欢迎且最成功的即时战略(RTS)游戏之一。近年来,由于其巨大的状态空间、部分可观测信息、多智能体协作等,SC 也被广泛接受为 AI 研究的一个具挑战性的测试平台。在年度 AIIDE 和 CIG 竞赛的助力下,越来越多 SC bot 被提出并持续改进。然而,顶级 bot 与职业人类玩家之间仍存在巨大差距。一个关键原因是当前 SC bot 主要依赖预定义规则在游戏中选宏观动作。这些规则可扩展性不足且效率不高,难以应对游戏中巨大且部分可观测的状态空间。本文中,我们提出一种深度强化学习(DRL)框架以改进宏观动作的选择。我们的框架基于 Ape-X DQN 与长短期记忆(LSTM)的结合。我们用此框架构建名为 LastOrder 的 bot。我们基于与 AIIDE 2017 星际争霸 AI 竞赛集中所有 bot 的训练对抗所做的评估显示,LastOrder 取得 83% 胜率,在总共 28 个参赛 bot 中胜过 26 个。
引用
@article{arxiv.1812.00336,
title = {Macro action selection with deep reinforcement learning in StarCraft},
author = {Sijia Xu and Hongyu Kuang and Zhi Zhuang and Renjie Hu and Yang Liu and Huyang Sun},
journal= {arXiv preprint arXiv:1812.00336},
year = {2019}
}