基于强化学习与课程迁移学习的星际争霸微操控制
人工智能
2018-04-04 v1 机器学习
多智能体系统
摘要
近年来,实时策略游戏已成为游戏人工智能的重要领域。本文提出一种强化学习与课程迁移学习方法,用于控制星际争霸微操中的多个单位。我们定义了高效的状态表示,以降低游戏环境中大状态空间带来的复杂性。随后提出一种参数共享多智能体梯度下降 Sarsa(λ)(PS-MAGDS)算法来训练单位。学习策略在单位间共享以鼓励协作行为。我们使用神经网络作为函数逼近器来估计动作值函数,并提出一种奖励函数以帮助单位平衡移动与攻击。此外,采用迁移学习将模型扩展至更困难场景,加速了训练过程并提升了学习性能。在小规模场景中,我们的单位成功学会战斗并以 100% 胜率击败内置 AI。在大规模场景中,使用课程迁移学习逐步训练一组单位,并在目标场景中表现出优于若干基线方法的性能。借助强化学习与课程迁移学习,我们的单位能够在星际争霸微操场景中学习到恰当策略。
引用
@article{arxiv.1804.00810,
title = {StarCraft Micromanagement with Reinforcement Learning and Curriculum Transfer Learning},
author = {Kun Shao and Yuanheng Zhu and Dongbin Zhao},
journal= {arXiv preprint arXiv:1804.00810},
year = {2018}
}
备注
12 pages, 14 figures, accepted to IEEE Transactions on Emerging Topics in Computational Intelligence