中文

利用深度学习从回放中学习星际争霸的宏观管理

人工智能 2017-07-13 v1

摘要

实时策略游戏星际争霸已被证明是人工智能技术的一个具有挑战性的环境,因此,当前最先进的解决方案由众多手工制作的模块组成。在本文中,我们展示了星际争霸中的宏观管理决策如何能够直接利用深度学习从游戏回放中学习。神经网络在从 2,005 个高水平玩家回放中提取的 789,571 个状态-动作对上进行训练,在预测下一个建造动作时达到了 54.6% 的 top-1 错误率和 22.9% 的 top-3 错误率。通过将训练好的网络集成到开源星际争霸机器人 UAlbertaBot 中,该系统可以显著优于游戏内置的 Terran 机器人,并与采用固定 rush 策略的 UAlbertaBot 进行竞争性对抗。据我们所知,这是首次在星际争霸中直接从回放学习宏观管理任务。虽然最佳的手工策略仍是最先进的,但深度网络方法能够表达多种不同的策略,因此通过深度强化学习进一步提升网络性能是一个立即可行的有前景的研究途径。最终,这种方法可能带来不太依赖硬编码策略的强大星际争霸机器人。

关键词

引用

@article{arxiv.1707.03743,
  title  = {Learning Macromanagement in StarCraft from Replays using Deep Learning},
  author = {Niels Justesen and Sebastian Risi},
  journal= {arXiv preprint arXiv:1707.03743},
  year   = {2017}
}

备注

8 pages, to appear in the proceedings of the IEEE Conference on Computational Intelligence and Games (CIG 2017)