超越奖励:离线多智能体行为分析的层次化视角
机器学习
2023-02-20 v3 多智能体系统
摘要
每年,在日益复杂的多智能体领域(著名例子包括围棋、扑克和星际争霸 II)中都会达到专家级表现。这种快速进步伴随着相应的需求,即更好地理解这些智能体如何达到此种表现,以便能够安全部署它们、识别局限性并揭示改进它们的潜在方法。在本文中,我们从以表现为中心的多智能体学习退后一步,转而将注意力投向智能体行为分析。我们引入了一种与模型无关的方法,用于在多智能体领域中发现行为簇,利用变分推断在联合和局部智能体层面学习行为层次结构。我们的框架不对智能体的底层学习算法做任何假设,不需要访问其潜在状态或策略,并且仅使用离线观测数据进行训练。我们展示了该方法在以下方面的有效性:实现联合和局部智能体层面行为的耦合理解、检测训练过程中的行为变化点、发现核心行为概念,证明了该方法对高维多智能体 MuJoCo 控制领域的可扩展性,并且还表明该方法可以解耦 OpenAI 捉迷藏领域中先前训练的策略。
引用
@article{arxiv.2206.09046,
title = {Beyond Rewards: a Hierarchical Perspective on Offline Multiagent Behavioral Analysis},
author = {Shayegan Omidshafiei and Andrei Kapishnikov and Yannick Assogba and Lucas Dixon and Been Kim},
journal= {arXiv preprint arXiv:2206.09046},
year = {2023}
}