中文

自主智能体群体的稳态策略合成

多智能体系统 2025-05-21 v2

摘要

稳态合成旨在为给定的马尔可夫决策过程 DD 构造策略,使得其长期平均访问频率满足给定数值约束。该问题可在多项式时间内解决,内存无关策略足以近似由通用(无限内存)策略实现的任意频率向量。我们研究的是多智能体系统的稳态合成问题,即多个自主智能体共同努力实现合适的频率向量。我们指出,针对多个智能体的问题是计算困难的(具体取决于变体类型,可能是PSPACE困难或NP困难),且内存无关策略轮廓不足以近似可实现的频率向量。此外,我们证明了即使评估给定内存轮廓实现的频率向量也计算困难。这揭示了即使针对内存轮廓也存在构建高效合成算法的严重障碍。尽管如此,我们设计了一个针对完全内存轮廓子类的高效可扩展合成算法,并在大量随机生成实例上对其进行评估。实验结果表明,该算法相对于基于策略共享的朴素算法具有显著的改进。

关键词

引用

@article{arxiv.2505.12406,
  title  = {Steady-State Strategy Synthesis for Swarms of Autonomous Agents},
  author = {Martin Jonáš and Antonín Kučera and Vojtěch Kůr and Jan Mačák},
  journal= {arXiv preprint arXiv:2505.12406},
  year   = {2025}
}