GHQ:面向异构协作多智能体强化学习的分组混合 Q 学习
多智能体系统
2024-08-15 v2 人工智能
机器学习
摘要
此前的深度多智能体强化学习(MARL)算法已取得令人印象深刻的成果,通常是在同构场景中。然而,异构场景同样十分常见且通常更难求解。本文主要讨论星际争霸多智能体挑战(SMAC)环境中的协作异构 MARL 问题。我们首先定义并描述了 SMAC 中的异构问题。为全面揭示和研究该问题,我们在原始 SMAC 地图之外新增了地图。我们发现基线算法在这些异构地图中表现不佳。为解决此问题,我们提出了分组个体-全局-最大一致性(GIGM)以及一种新颖的 MARL 算法——分组混合 Q 学习(GHQ)。GHQ 将智能体分为若干组并为每组保留独立参数,同时采用一种新颖的混合结构进行因式分解。为增强组间协调,我们最大化组间轨迹的互信息(IGMI)。在原始及新增异构地图上的实验表明,与其他最先进算法相比,GHQ 具有极佳的性能。
引用
@article{arxiv.2303.01070,
title = {GHQ: Grouped Hybrid Q Learning for Heterogeneous Cooperative Multi-agent Reinforcement Learning},
author = {Xiaoyang Yu and Youfang Lin and Xiangsen Wang and Sheng Han and Kai Lv},
journal= {arXiv preprint arXiv:2303.01070},
year = {2024}
}