面向深度多智能体强化学习的单调值函数分解
机器学习
2020-09-22 v2 多智能体系统
机器学习
摘要
在许多真实场景中,一组智能体必须以去中心化方式行动的同时协调其行为。与此同时,常可在集中式条件下训练智能体,此时全局状态信息可用且通信限制被解除。学习以额外状态信息为条件的联合动作值是一种利用集中式学习的吸引人方式,但随后提取去中心化策略的最佳策略尚不明晰。我们的解决方案是QMIX,一种新颖的基于值的方法,能够以集中式端到端方式训练去中心化策略。QMIX采用一个混合网络,将联合动作值估计为各智能体值的单调组合。我们通过混合网络中的非负权重从结构上保证联合动作值对各智能体值单调,从而确保集中式与去中心化策略间的一致性。为评估QMIX性能,我们提出星海争霸多智能体挑战(SMAC)作为深度多智能体强化学习的新基准。我们在具挑战性的一组SMAC场景上评估QMIX,并显示其显著优于现有多智能体强化学习方法。
引用
@article{arxiv.2003.08839,
title = {Monotonic Value Function Factorisation for Deep Multi-Agent Reinforcement Learning},
author = {Tabish Rashid and Mikayel Samvelyan and Christian Schroeder de Witt and Gregory Farquhar and Jakob Foerster and Shimon Whiteson},
journal= {arXiv preprint arXiv:2003.08839},
year = {2020}
}
备注
Extended version of the ICML 2018 conference paper (arXiv:1803.11485)