通过宏观目标在 MOBA 游戏中学习多样化策略
机器学习
2021-10-28 v1 人工智能
摘要
近年来,许多研究者在利用深度强化学习构建 MOBA 游戏 AI 系统方面取得了成功进展,例如在 Dota 2 和王者荣耀上。尽管这些 AI 系统已经达到甚至超越了人类水平的表现,它们仍然受限于策略多样性的缺乏。在本文中,我们提出了一种新颖的宏观目标引导框架,称为 MGG,以在 MOBA 游戏中学习多样化策略。MGG 从人类演示中将策略抽象为宏观目标,并训练一个元控制器(Meta-Controller)来预测这些宏观目标。为了增强策略多样性,MGG 从元控制器的预测中采样宏观目标,并引导训练过程朝向这些目标。在典型 MOBA 游戏王者荣耀上的实验结果表明,MGG 能够在不同的对局和阵容中执行多样化策略,并且在 102 个英雄上优于最先进的方法。
引用
@article{arxiv.2110.14221,
title = {Learning Diverse Policies in MOBA Games via Macro-Goals},
author = {Yiming Gao and Bei Shi and Xueying Du and Liang Wang and Guangwei Chen and Zhenjie Lian and Fuhao Qiu and Guoan Han and Weixuan Wang and Deheng Ye and Qiang Fu and Wei Yang and Lanxiao Huang},
journal= {arXiv preprint arXiv:2110.14221},
year = {2021}
}
备注
Accepted at NeurIPS 2021