关于星际争霸 II 完整对局的高效强化学习
机器学习
2022-10-05 v1 人工智能
摘要
星际争霸 II(SC2)对强化学习(RL)提出了巨大挑战,其主要困难包括巨大的状态空间、变化的动作空间以及长的时间跨度。本工作中,我们研究了一套用于星际争霸 II 完整对局的 RL 技术。我们研究了一种涉及提取宏动作与神经网络分层架构的分层 RL 方法。我们研究了一种课程迁移训练流程,并在一台配备 4 块 GPU 与 48 个 CPU 线程的单机上进行智能体训练。在 64x64 地图上并使用受限单位时,我们取得了对 level-1 内置 AI 99% 的胜率。通过课程迁移学习算法与战斗模型混合,我们取得了对最难的非作弊内置 AI(level-7)93% 的胜率。在本文扩展版中,我们改进架构以训练智能体对抗作弊 level AI,并分别取得对 level-8、level-9 与 level-10 AI 96%、97% 与 94% 的胜率。我们的代码位于 https://github.com/liuruoze/HierNet-SC2。为提供参照 AlphaStar 的基线以裨益本研究及研究与开源社区,我们复现了其缩减版 mini-AlphaStar(mAS)。mAS 最新版本为 1.07,可在具有 564 个动作的原始动作空间上训练。它设计为通过使超参数可调而在单台普通机器上运行训练。随后我们在相同资源下将我们的工作与 mAS 比较,表明我们的方法更为有效。mini-AlphaStar 的代码位于 https://github.com/liuruoze/mini-AlphaStar。我们希望我们的研究能为未来 SC2 及其他大规模游戏上高效强化学习的研究提供启示。
引用
@article{arxiv.2209.11553,
title = {On Efficient Reinforcement Learning for Full-length Game of StarCraft II},
author = {Ruo-Ze Liu and Zhen-Jia Pang and Zhou-Yu Meng and Wenhai Wang and Yang Yu and Tong Lu},
journal= {arXiv preprint arXiv:2209.11553},
year = {2022}
}
备注
48 pages,21 figures