中文

SMAC-Hard:在 SMAC 上实现混合对手策略脚本和自我对弈

人工智能 2024-12-25 v2

摘要

挑战性模拟环境的可用性是推动多智能体强化学习(MARL)领域发展的关键因素。在合作 MARL 设置中,StarCraft Multi-Agent Challenge(SMAC)作为集中训练、分布执行范式下的基准算法而备受推崇。然而,随着 SMAC 持续发展,许多算法现在表现出接近最优的性能,这使得评估其真实有效性变得复杂。为缓解这一问题,我们指出一个关键问题:这些环境中默认的对手策略缺乏足够的多样性,导致 MARL 算法过拟合并利用意外的漏洞,而非学习鲁棒策略。为克服这些限制,我们提出 SMAC-HARD,一个旨在增强训练鲁棒性和评估全面性的新基准。SMAC-HARD 支持可定制的对手策略、随机化对抗策略,以及 MARL 自我对弈的接口,使代理能够对变化的对手行为进行泛化并提高模型稳定性。此外,我们引入了一个黑箱测试框架,其中在不接触编辑后手脚本的情况下训练代理,但对这些脚本进行测试,以评估 MARL 算法的政策覆盖范围和适应性。我们对 SMAC-HARD 上广泛使用的和最新算法进行了大量评估,揭示了编辑后和混合策略对手提出的重大挑战。此外,黑箱策略测试说明了将已学习的策略转移到未见对手的难度。我们设想 SMAC-HARD 是通向下一代 MARL 算法基准的关键一步,促进多智能体系统中自我对弈方法的进展。我们的代码已公开于 https://github.com/devindeng94/smac-hard。

关键词

引用

@article{arxiv.2412.17707,
  title  = {SMAC-Hard: Enabling Mixed Opponent Strategy Script and Self-play on SMAC},
  author = {Yue Deng and Yan Yu and Weiyu Ma and Zirui Wang and Wenhui Zhu and Jian Zhao and Yin Zhang},
  journal= {arXiv preprint arXiv:2412.17707},
  year   = {2024}
}