中文

基于自聚类层次化多智能体强化学习的可扩展合作图

人工智能 2024-03-28 v1

摘要

多智能体强化学习 (MARL) 已在解决众多合作挑战方面取得成功。然而,经典的非层次化MARL算法仍无法解决需要层次化合作行为的各种复杂多智能体问题。非层次化算法中学习到的合作知识和策略是隐式且不可解释的,从而限制了现有知识的集成。本文提出了一种新颖的层次化MARL模型,称为层次化合作图学习 (Hierarchical Cooperation Graph Learning, HCGL),用于解决通用的多智能体问题。HCGL包含三个组件:用于实现自聚类合作的动态可扩展合作图 (Extensible Cooperation Graph, ECG);用于调整ECG拓扑结构的图算子集合;以及用于训练这些图算子的MARL优化器。HCGL与其他MARL模型的关键区别在于,智能体的行为是由ECG的拓扑结构引导,而非由策略神经网络。ECG是一个三层图,包括智能体节点层、聚类节点层和目标节点层。为响应环境条件的变化,训练四个图算子以动态调整ECG的边连接。ECG的层次化特征提供了一种独特的方法,将原始动作(由智能体执行的动作)和协作动作(由聚类执行的动作)融合到统一的动作空间中,从而将基本的合作知识集成到可扩展的接口中。在实验中,HCGL模型在带有稀疏奖励的多智能体基准测试中表现出色。我们还验证了HCGL可以轻松迁移到大规模场景,且零样本迁移成功率较高。

关键词

引用

@article{arxiv.2403.18056,
  title  = {Self-Clustering Hierarchical Multi-Agent Reinforcement Learning with Extensible Cooperation Graph},
  author = {Qingxu Fu and Tenghai Qiu and Jianqiang Yi and Zhiqiang Pu and Xiaolin Ai},
  journal= {arXiv preprint arXiv:2403.18056},
  year   = {2024}
}