中文

基于启发式多样性的多智能体鲁棒性诊断

机器学习 2024-11-05 v3 人工智能 多智能体系统

摘要

在快速发展的多智能体系统领域,确保其在陌生和对抗环境中的鲁棒性至关重要。尽管这些系统在熟悉环境中表现出色,但由于训练阶段的过拟合,它们在新情况下常常表现不佳。在同时存在合作与竞争行为的环境中,这一点尤为明显,体现了过拟合与泛化挑战的双重性质。为了解决这个问题,我们提出了基于启发式多样性的多智能体鲁棒性诊断(MADRID),这是一种生成多样化对抗场景的新方法,能够暴露预训练多智能体策略中的战略漏洞。利用开放式学习中的概念,MADRID 在广阔的对抗环境空间中进行导航,采用目标策略的遗憾值来衡量这些环境的脆弱性。我们在 Google Research Football 的 11vs11 版本上评估了 MADRID 的有效性,这是多智能体强化学习中最复杂的环境之一。具体而言,我们使用 MADRID 为 TiZero 生成了一系列多样化的对抗环境,TiZero 是一种通过在大规模分布式基础设施上训练 45 天而“精通”该游戏的 SOTA 方法。我们揭示了 TiZero 在战术决策上的关键缺陷,凸显了多智能体系统中严格评估的至关重要性。

关键词

引用

@article{arxiv.2401.13460,
  title  = {Multi-Agent Diagnostics for Robustness via Illuminated Diversity},
  author = {Mikayel Samvelyan and Davide Paglieri and Minqi Jiang and Jack Parker-Holder and Tim Rocktäschel},
  journal= {arXiv preprint arXiv:2401.13460},
  year   = {2024}
}