中文

多智能体 POMDP 中的因子化在线规划

人工智能 2024-02-26 v3 多智能体系统

摘要

在集中式多智能体系统(通常建模为多智能体部分可观测马尔可夫决策过程,MPOMDPs)中,动作空间和观测空间随智能体数量呈指数级增长,使得单智能体在线规划的价值和信念估计失效。先前的工作通过利用多智能体设置中固有的结构(即所谓的协调图)部分解决了价值估计问题。此外,通过将观测似然纳入近似过程,信念估计方法得到了改进。然而,价值估计和信念估计的挑战一直是单独解决的,这阻碍了现有方法扩展到包含大量智能体的场景。因此,我们同时解决这些挑战。首先,我们将加权粒子滤波引入到基于采样的 MPOMDPs 在线规划器中。其次,我们提出了一种可扩展的信念近似方法。第三,我们利用智能体交互的典型局部性,将其应用于在所谓的稀疏粒子滤波树上运行的新型 MPOMDPs 在线规划算法。我们与几种最先进基线的实验评估表明,我们的方法(1)在仅有少量智能体的场景中具有竞争力,(2)在存在大量智能体时优于基线。

关键词

引用

@article{arxiv.2312.11434,
  title  = {Factored Online Planning in Many-Agent POMDPs},
  author = {Maris F. L. Galesloot and Thiago D. Simão and Sebastian Junges and Nils Jansen},
  journal= {arXiv preprint arXiv:2312.11434},
  year   = {2024}
}

备注

Extended version (includes the Appendix) of the paper accepted at AAAI-24