SMACv2:一种改进的合作多智能体强化学习基准
机器学习
2023-10-18 v2 多智能体系统
摘要
具有挑战性的基准的可用性在机器学习近期的进展中发挥了关键作用。在合作多智能体强化学习中,星际争霸多智能体挑战(SMAC)已成为集中训练分散执行的热门测试平台。然而,经过多年在SMAC上的持续改进,算法现已达到近乎完美的性能。在这项工作中,我们进行了新的分析,证明SMAC缺乏随机性和部分可观测性,从而不需要复杂的*闭环*策略。特别地,我们表明,仅以时间步为条件的*开环*策略就能在许多SMAC场景中取得非平凡的胜率。为应对这一局限,我们引入了SMACv2,这是该基准的新版本,其中场景以程序化方式生成,并要求智能体在评估时对先前未见过(来自同一分布)的设置进行泛化。我们还引入了扩展部分可观测性挑战(EPO),它对SMACv2进行增强以确保有意义的部分可观测性。我们表明,这些变更确保了基准需要使用*闭环*策略。我们在SMACv2上评估了最先进的算法,并表明它呈现出原基准中不存在的显著挑战。我们的分析说明,SMACv2解决了已发现的SMAC缺陷,并有助于对下一代MARL方法进行基准测试。训练视频可在 https://sites.google.com/view/smacv2 获取。
引用
@article{arxiv.2212.07489,
title = {SMACv2: An Improved Benchmark for Cooperative Multi-Agent Reinforcement Learning},
author = {Benjamin Ellis and Jonathan Cook and Skander Moalla and Mikayel Samvelyan and Mingfei Sun and Anuj Mahajan and Jakob N. Foerster and Shimon Whiteson},
journal= {arXiv preprint arXiv:2212.07489},
year = {2023}
}