中文

关于星际争霸完整对局的强化学习

机器学习 2019-02-05 v2 人工智能 机器学习

摘要

星际争霸 II 对强化学习提出了巨大挑战。其主要困难包括巨大的状态与动作空间以及长时域。本文中,我们研究了一种面向星际争霸 II 的分层强化学习方法。该层次结构涉及两级抽象。其一为由专家轨迹自动提取的宏动作,它将动作空间缩减了一个数量级且仍然有效。其二是模块化且易于扩展的两层分层架构,使得从较简单任务到更复杂任务的课程迁移成为可能。该架构的强化训练算法亦被研究。在 64x64 地图上并使用受限单位,我们取得了对难度等级 1 内置 AI 超过 99\% 的胜率。通过课程迁移学习算法与战斗模型混合,我们能在仅用 48 个 CPU 核与 8 块 K40 GPU 的单机、两天内训练,取得神族对最困难非作弊内置 AI(人族等级 7)超过 93\% 的胜率。当针对从未见过的对手(包括作弊等级内置 AI 及全等级虫族与神族内置 AI)测试时,它也展现出强大的泛化性能。我们希望本研究能为大规模强化学习的未来研究提供些许启示。

关键词

引用

@article{arxiv.1809.09095,
  title  = {On Reinforcement Learning for Full-length Game of StarCraft},
  author = {Zhen-Jia Pang and Ruo-Ze Liu and Zhou-Yu Meng and Yi Zhang and Yang Yu and Tong Lu},
  journal= {arXiv preprint arXiv:1809.09095},
  year   = {2019}
}

备注

Appeared in AAAI 2019