中文

TAPE:利用智能体拓扑进行合作多智能体策略梯度

多智能体系统 2024-01-17 v3 人工智能

摘要

多智能体策略梯度(MAPG)近年来取得了显著进展。然而,最先进的MAPG方法中的集中式评论家仍然面临集中-分散不匹配(CDM)问题,这意味着某些智能体的次优行动会影响其他智能体的策略学习。虽然使用个体评论家进行策略更新可以避免这个问题,但它们严重限制了智能体之间的合作。为了解决这个问题,我们提出了一个智能体拓扑框架,它决定在策略梯度中是否考虑其他智能体,并在促进合作和缓解CDM问题之间取得折衷。智能体拓扑允许智能体使用联盟效用作为学习目标,而不是集中式评论家的全局效用或个体评论家的局部效用。为了构成智能体拓扑,我们研究了多种模型。我们提出了基于拓扑的多智能体策略梯度(TAPE),适用于随机和确定性MAPG方法。我们证明了随机TAPE的策略改进定理,并给出了智能体间合作改善的理论解释。在多个基准上的实验结果表明,智能体拓扑能够分别促进智能体合作和缓解CDM问题,从而提升TAPE的性能。最后,我们设计了多项消融研究和启发式图搜索算法来展示智能体拓扑的有效性。

关键词

引用

@article{arxiv.2312.15667,
  title  = {TAPE: Leveraging Agent Topology for Cooperative Multi-Agent Policy Gradient},
  author = {Xingzhou Lou and Junge Zhang and Timothy J. Norman and Kaiqi Huang and Yali Du},
  journal= {arXiv preprint arXiv:2312.15667},
  year   = {2024}
}