中文

QFree:一种用于多智能体强化学习的通用值函数分解方法

人工智能 2023-11-02 v1

摘要

集中式训练在多智能体强化学习(MARL)领域被广泛采用以保证训练过程的稳定性。一旦获得联合策略,设计值函数分解方法以提取智能体的最优分散策略至关重要,该方法需满足个体-全局-最大(IGM)原则。虽然对 IGM 函数类施加额外限制有助于满足要求,但其代价是限制了在更复杂多智能体环境中的应用。本文提出 QFree,一种用于 MARL 的通用值函数分解方法。我们首先基于优势函数建立了 IGM 原则的数学等价条件,确保该原则毫无折衷地成立,消除了传统方法的保守性。随后我们构建了更具表达力的混合网络架构以实现等价分解。特别地,在 MARL 算法的策略评估中,通过将等价条件作为正则化项,设计了新颖的损失函数。最后,在一个非单调矩阵博弈场景中验证了所提方法的有效性。此外,我们表明 QFree 在通用复杂 MARL 基准环境 Starcraft Multi-Agent Challenge(SMAC)中达到了最先进(SOTA)性能。

关键词

引用

@article{arxiv.2311.00356,
  title  = {QFree: A Universal Value Function Factorization for Multi-Agent Reinforcement Learning},
  author = {Rizhong Wang and Huiping Li and Di Cui and Demin Xu},
  journal= {arXiv preprint arXiv:2311.00356},
  year   = {2023}
}