加权QMIX:扩展深度多智能体强化学习中单调值函数分解
机器学习
2020-10-23 v2 多智能体系统
机器学习
摘要
QMIX是一种流行的学习算法,用于集中训练与分散执行范式下的合作型多智能体强化学习(MARL)。为了便于分散执行,QMIX将其所能表示的联合动作值限制为各智能体效用的单调混合。然而,这一限制使其无法表示某些智能体动作排序依赖于其他智能体动作的值函数。为分析这一表示局限,我们首先形式化了QMIX所优化的目标,从而将QMIX视为一个算子:它先计算学习目标,再将其投影到QMIX可表示的空间中。该投影返回一个可表示的值,使所有联合动作上的未加权平方误差最小。我们特别指出,即使能访问,该投影也可能无法恢复最优策略,这主要源于对每个联合动作的等权处理。我们通过引入投影中的权重来纠正这一问题,以对较优的联合动作赋予更高的重要性。我们提出两种加权方案,并证明它们能对任意联合动作值、从而对也恢复正确的极大动作。基于我们的分析及表格环境下的结果,我们引入了两种可扩展的算法版本:中心加权(CW)QMIX与乐观加权(OW)QMIX,并在捕食者-猎物及具有挑战性的多智能体StarCraft基准任务上展示了性能提升。
引用
@article{arxiv.2006.10800,
title = {Weighted QMIX: Expanding Monotonic Value Function Factorisation for Deep Multi-Agent Reinforcement Learning},
author = {Tabish Rashid and Gregory Farquhar and Bei Peng and Shimon Whiteson},
journal= {arXiv preprint arXiv:2006.10800},
year = {2020}
}