QMIX:面向深度多智能体强化学习的单调值函数分解
机器学习
2018-06-07 v2 多智能体系统
机器学习
摘要
在许多真实场景中,一组智能体必须以分散方式行动的同时协调其行为。与此同时,常在模拟或实验室环境中以集中方式训练智能体,此时全局状态信息可用且通信限制解除。基于额外状态信息学习联合动作值是一种利用集中学习的吸引人方式,但随后提取分散策略的最佳策略尚不明晰。我们的解决方案是 QMIX,一种新颖的基于值的方法,能以集中端到端方式训练分散策略。QMIX 采用一个网络,将联合动作值估计为仅以局部观测为条件的各智能体值的复杂非线性组合。我们从结构上强制联合动作值对各智能体值单调,从而在离策学习中实现联合动作值的可处理最大化,并保证集中与分散策略间的一致性。我们在极具挑战的 StarCraft II 微操任务上评估 QMIX,表明其显著优于现有的基于值的多智能体强化学习方法。
引用
@article{arxiv.1803.11485,
title = {QMIX: Monotonic Value Function Factorisation for Deep Multi-Agent Reinforcement Learning},
author = {Tabish Rashid and Mikayel Samvelyan and Christian Schroeder de Witt and Gregory Farquhar and Jakob Foerster and Shimon Whiteson},
journal= {arXiv preprint arXiv:1803.11485},
year = {2018}
}
备注
Camera-ready version, International Conference of Machine Learning 2018