FACMAC:因子化多智能体中心化策略梯度
机器学习
2021-05-10 v5 人工智能
机器学习
摘要
我们提出 FACtored Multi-Agent Centralised policy gradients(FACMAC,因子化多智能体中心化策略梯度),一种用于离散与连续动作空间中协作式多智能体强化学习的新方法。如同流行的多智能体 actor-critic 方法 MADDPG,我们的方法使用深度确定性策略梯度来学习策略。然而,FACMAC 学习一个中心化但因子化的评论家,其通过非线性单调函数将各智能体效用组合为联合动作值函数,正如流行的多智能体 Q-learning 算法 QMIX。但与 QMIX 不同,对评论家的因子化没有内在约束。因此我们亦采用非单调因子化,并凭经验证明其所增加的表示能力使其能解决一些使用整体式或单调因子化评论家无法解决的任务。此外,FACMAC 使用中心化策略梯度估计器,在整体联合动作空间上优化,而非如 MADDPG 中分别在各智能体动作空间上优化。这允许更协调的策略变更并充分获取中心化评论家的益处。我们在多智能体粒子环境的变体、新颖的多智能体 MuJoCo 基准以及一组具挑战性的 StarCraft II 微操任务上评估 FACMAC。经验结果表明 FACMAC 在所有三个领域均优于 MADDPG 与其他基线。
引用
@article{arxiv.2003.06709,
title = {FACMAC: Factored Multi-Agent Centralised Policy Gradients},
author = {Bei Peng and Tabish Rashid and Christian A. Schroeder de Witt and Pierre-Alexandre Kamienny and Philip H. S. Torr and Wendelin Böhmer and Shimon Whiteson},
journal= {arXiv preprint arXiv:2003.06709},
year = {2021}
}