中文

多智能体强化学习中的图卷积值分解

机器学习 2021-02-11 v2 多智能体系统

摘要

我们提出了一种利用图神经网络(GNNs)进行多智能体深度强化学习(MARL)中值函数分解的新框架。具体而言,我们将智能体团队视为一个完全有向图的节点集合,其边权重由注意力机制控制。在此基础图上,我们引入了一个混合 GNN 模块,负责 i) 将团队状态-动作值函数分解为各个智能体的逐观测-动作值函数,以及 ii) 以全局团队奖励份额的形式对每个智能体进行显式信用分配。我们的方法称为 GraphMIX,遵循集中训练与分散执行范式,使智能体在训练完成后能够独立决策。我们在 StarCraft II 多智能体挑战(SMAC)基准的若干场景上展示了 GraphMIX 相对于最先进方法的优越性。我们进一步演示了如何将 GraphMIX 与近期的一种分层 MARL 架构结合使用,以同时提升智能体性能,并使其能够在具有更多智能体和/或动作的错配测试场景上进行微调。

关键词

引用

@article{arxiv.2010.04740,
  title  = {Graph Convolutional Value Decomposition in Multi-Agent Reinforcement Learning},
  author = {Navid Naderializadeh and Fan H. Hung and Sean Soleyman and Deepak Khosla},
  journal= {arXiv preprint arXiv:2010.04740},
  year   = {2021}
}