面向塔防线战的深度强化学习方法初探
人工智能
2017-12-19 v1
摘要
近年来强化学习取得了众多突破,或许最引人注目的是深度强化学习成功游玩并战胜了相对高级的电脑游戏。毫无疑问,人们期待当首个 AI 掌握击败职业即时战略游戏玩家所需的复杂游戏操作时,深度强化学习将发挥重要作用。要实现这一点,需要一个针对并推动 AI 研究、特别是深度强化学习的游戏环境。已有一些游戏环境存在,然而它们要么过于简单(如 Atari 2600),要么过于复杂(如暴雪娱乐的星际争霸 II)。我们提出了一种介于 Atari 2600 与星际争霸 II 之间的游戏环境,特别面向深度强化学习算法研究。该环境是暴雪娱乐《魔兽争霸 III》中塔防线战的一个变体。此外,作为该环境可承载深度强化算法的概念验证,我们提出并应用了一种深度 Q 强化架构。该架构简化了状态空间以使其适用于 Q-learning,进而相比当前最先进的方法提升了性能。我们的实验表明,所提架构能够很好地学习游玩该环境,并且比标准深度 Q-learning 得分高出 33%,这反过来证明了该游戏环境的实用性。
引用
@article{arxiv.1712.06180,
title = {Towards a Deep Reinforcement Learning Approach for Tower Line Wars},
author = {Per-Arne Andersen and Morten Goodwin and Ole-Christoffer Granmo},
journal= {arXiv preprint arXiv:1712.06180},
year = {2017}
}
备注
Proceedings of the 37th SGAI International Conference on Artificial Intelligence, Cambridge, UK, 2017, Artificial Intelligence XXXIV, 2017