中文

面向多智能体选项发现的智能体间相对表征

机器学习 2026-04-21 v3

摘要

时间扩展动作提高了单智能体环境中的探索和规划能力。在多智能体环境中,联合状态空间随智能体数量呈指数增长,这使得协调行为变得更有价值。然而,同样的指数增长使得多智能体选项的设计尤为困难。现有的多智能体选项发现方法通常通过产生松散耦合或完全独立的行为来牺牲协调性。为解决这些局限性,我们描述了一种新颖的多智能体选项发现方法。具体而言,我们提出了一种联合状态抽象,它在压缩状态空间的同时保留了发现强协调行为所需的信息。我们的方法基于一个归纳偏置:在没有明确目标的情况下,智能体状态上的同步为协调提供了自然基础。我们首先近似一个与团队最大对齐的虚构状态,即“费马”状态,并用它定义一个“分散度”度量,以捕捉团队在每个单独状态维度上的失配程度。基于此表征,我们随后采用神经图拉普拉斯估计器来推导出捕捉智能体间状态同步模式的选项。我们在两个模拟多智能体领域的多个场景中评估了所得选项,结果表明,与其他选项发现方法相比,它们产生了更强的下游协调能力。

关键词

引用

@article{arxiv.2512.24827,
  title  = {Inter-Agent Relative Representations for Multi-Agent Option Discovery},
  author = {Raul D. Steleac and Mohan Sridharan and David Abel},
  journal= {arXiv preprint arXiv:2512.24827},
  year   = {2026}
}