中文

基于图注意力的部分可观测平均场多智能体强化学习

人工智能 2024-09-10 v4

摘要

传统的多智能体强化学习算法难以应用于大规模多智能体环境。近年来,平均场理论的引入增强了多智能体强化学习的可扩展性。本文考虑部分可观测多智能体强化学习(MARL),其中每个智能体只能观测固定范围内的其他智能体。这种部分可观测性影响了智能体评估周围智能体动作质量的能力。本文致力于开发一种从局部观测中捕获更有效信息以选择更有效动作的方法。该领域先前的工作采用概率分布或加权平均场来更新邻域智能体的平均动作,但未能充分考虑周围邻居的特征信息,导致陷入局部最优。本文中,我们提出一种新颖的多智能体强化学习算法,即基于图注意力的部分可观测平均场多智能体强化学习(GAMFQ),以弥补这一缺陷。GAMFQ使用图注意力模块和平均场模块来描述每个时间步智能体受其他智能体动作影响的方式。该图注意力模块由图注意力编码器与可微注意力机制组成,该机制输出动态图以表示邻域智能体对中心智能体的有效性。平均场模块将邻域智能体对中心智能体的影响近似为有效邻域智能体的平均影响。实验表明,GAMFQ优于包括最先进的部分可观测平均场强化学习算法在内的基线方法。本文代码见 \url{https://github.com/yangmin32/GPMF}。

关键词

引用

@article{arxiv.2304.12653,
  title  = {Partially Observable Mean Field Multi-Agent Reinforcement Learning Based on Graph-Attention},
  author = {Min Yang and Guanjun Liu and Ziyuan Zhou},
  journal= {arXiv preprint arXiv:2304.12653},
  year   = {2024}
}