QPLEX:双工对决式多智能体 Q 学习
机器学习
2021-10-05 v3 人工智能
多智能体系统
机器学习
摘要
我们在广受欢迎的集中训练与分散执行(CTDE)范式下探索基于价值的多智能体强化学习(MARL)。CTDE 有一个重要概念,即个体-全局-最大(IGM)原则,它要求联合动作选择与局部动作选择之间的一致性,以支持高效的局部决策。然而,为了实现可扩展性,现有的 MARL 方法要么限制其值函数类的表示表达能力,要么放松 IGM 一致性,这可能面临不稳定性风险,或在复杂领域中表现不佳。本文提出一种新颖的 MARL 方法,称为双工对决式多智能体 Q 学习(QPLEX),它采用双工对决网络架构来分解联合值函数。该双工对决结构将 IGM 原则编码进神经网络架构中,从而实现高效的值函数学习。理论分析表明,QPLEX 实现了完整的 IGM 函数类。在星际争霸 II 微操任务上的实证实验表明,QPLEX 在在线与离线数据收集设置下均显著优于最先进的基线,并且揭示 QPLEX 实现了高样本效率,且可受益于离线数据集而无需额外的在线探索。
引用
@article{arxiv.2008.01062,
title = {QPLEX: Duplex Dueling Multi-Agent Q-Learning},
author = {Jianhao Wang and Zhizhou Ren and Terry Liu and Yang Yu and Chongjie Zhang},
journal= {arXiv preprint arXiv:2008.01062},
year = {2021}
}