中文

超越奖励:离线多智能体行为分析的层次化视角

机器学习 2023-02-20 v3 多智能体系统

摘要

每年,在日益复杂的多智能体领域(著名例子包括围棋、扑克和星际争霸 II)中都会达到专家级表现。这种快速进步伴随着相应的需求,即更好地理解这些智能体如何达到此种表现,以便能够安全部署它们、识别局限性并揭示改进它们的潜在方法。在本文中,我们从以表现为中心的多智能体学习退后一步,转而将注意力投向智能体行为分析。我们引入了一种与模型无关的方法,用于在多智能体领域中发现行为簇,利用变分推断在联合和局部智能体层面学习行为层次结构。我们的框架不对智能体的底层学习算法做任何假设,不需要访问其潜在状态或策略,并且仅使用离线观测数据进行训练。我们展示了该方法在以下方面的有效性:实现联合和局部智能体层面行为的耦合理解、检测训练过程中的行为变化点、发现核心行为概念,证明了该方法对高维多智能体 MuJoCo 控制领域的可扩展性,并且还表明该方法可以解耦 OpenAI 捉迷藏领域中先前训练的策略。

关键词

引用

@article{arxiv.2206.09046,
  title  = {Beyond Rewards: a Hierarchical Perspective on Offline Multiagent Behavioral Analysis},
  author = {Shayegan Omidshafiei and Andrei Kapishnikov and Yannick Assogba and Lucas Dixon and Been Kim},
  journal= {arXiv preprint arXiv:2206.09046},
  year   = {2023}
}