深度确定性策略的情景式探索:在星际争霸微操任务中的应用
人工智能
2016-11-29 v3 机器学习
摘要
我们将即时战略游戏星际争霸中的场景作为强化学习算法的新基准。我们提出了微操任务,该任务涉及战斗期间对军队成员的短期、低级控制。从强化学习的角度来看,这些场景具有挑战性,因为状态-动作空间非常大,且状态-动作评估函数没有明显的特征表示。我们描述了利用游戏引擎给出的原始状态特征,通过深度神经网络控制器来解决微操场景的方法。此外,我们提出了一种启发式强化学习算法,该算法结合了策略空间中的直接探索和反向传播。该算法允许使用确定性策略收集用于学习的轨迹,这看起来比例如 {\epsilon}-greedy 探索高效得多。实验表明,使用该算法,我们成功地为最多包含 15 个智能体的军队场景学习到了非平凡的策略,而在这些场景中 Q-learning 和 REINFORCE 均表现不佳。
引用
@article{arxiv.1609.02993,
title = {Episodic Exploration for Deep Deterministic Policies: An Application to StarCraft Micromanagement Tasks},
author = {Nicolas Usunier and Gabriel Synnaeve and Zeming Lin and Soumith Chintala},
journal= {arXiv preprint arXiv:1609.02993},
year = {2016}
}
备注
18 pages, 1 figure (2 plots), 2 tables