有限队友通信下多智能体对抗游戏中的样本高效训练
机器学习
2020-11-03 v1 多智能体系统
摘要
我们描述了针对 Pommerman TeamRadio 的解决方案,该环境是与 NeurIPS 2019 相关的竞赛环境。我们算法的显著特征是在受限的计算预算内实现样本效率,同时击败前一年的学习智能体。所提出的算法(i)使用模仿学习来初始化策略,(ii)明确定义两名队友之间的通信协议,(iii)塑造奖励以在训练期间为每个智能体提供更丰富的反馈信号,以及(iv)对灾难性坏动作使用掩码。我们描述了对基线的广泛测试,包括来自 2019 年竞赛排行榜的基线,以及对学习策略和每项修改对性能影响的专门调查。我们表明,所提出的方法能够在五十万局训练内达到具有竞争力的性能,显著快于文献中的其他研究。
引用
@article{arxiv.2011.00424,
title = {Sample Efficient Training in Multi-Agent Adversarial Games with Limited Teammate Communication},
author = {Hardik Meisheri and Harshad Khadilkar},
journal= {arXiv preprint arXiv:2011.00424},
year = {2020}
}