中文

面向大规模异构多智能体系统的优先级联盟强化学习

人工智能 2024-03-28 v1

摘要

大规模异构多智能体系统在现实世界中包含各种真实因素,例如具有不同能力的智能体以及整体系统成本。相较于同构系统,异构系统具有显著的实际优势。然而,它们也为多智能体强化学习带来了挑战,包括解决非平稳问题和管理不同类型的智能体数量的不平衡。我们提出了一种优先级异构联盟强化学习 (Prioritized Heterogeneous League Reinforcement Learning, PHLRL) 方法,以解决大规模异构合作问题。PHLRL维护一记录各智能体在训练期间探索的各种政策,并建立由多样化政策组成的异构联盟,以辅助未来的政策优化。此外,我们设计了一种优先级政策梯度方法,以弥补不同类型智能体数量差异所导致的差距。随后,我们使用Unreal Engine设计了一个名为大规模多智能体操作 (Large-Scale Multiagent Operation, LSMO) 的大规模异构合作基准测试,它是一个复杂的双队竞争场景,需要来自地面和空中智能体的协作。我们通过实验表明,PHLRL在LSMO中优于包括QTRAN和QPLEX在内的最先进方法。

关键词

引用

@article{arxiv.2403.18057,
  title  = {Prioritized League Reinforcement Learning for Large-Scale Heterogeneous Multiagent Systems},
  author = {Qingxu Fu and Zhiqiang Pu and Min Chen and Tenghai Qiu and Jianqiang Yi},
  journal= {arXiv preprint arXiv:2403.18057},
  year   = {2024}
}