QVMix 与 QVMix-Max:将深度质量-价值算法族扩展至合作多智能体强化学习
机器学习
2020-12-23 v1 人工智能
多智能体系统
摘要
本文介绍了四种可用于解决合作场景下多智能体强化学习(MARL)问题的新算法。所有算法均基于深度质量-价值(DQV)算法族,这是一组在处理单智能体强化学习(SARL)问题时已被证明成功的技术。DQV 算法的核心思想是联合学习状态价值函数 的近似与状态-动作价值函数 的近似。我们遵循该原则并对这些算法进行推广,引入了两种完全去中心化的 MARL 算法(IQV 与 IQV-Max)以及两种基于集中训练与去中心化执行训练范式(CTDE)的算法(QVMix 与 QVMix-Max)。我们在流行的 StarCraft Multi-Agent Challenge(SMAC)环境中将我们的算法与最先进的 MARL 技术进行比较。我们展示了当 QVMix 和 QVMix-Max 与 QMIX 和 MAVEN 等知名 MARL 技术比较时具有竞争力,并表明 QVMix 甚至能在部分测试环境中超越它们,是总体表现最佳的算法。我们推测这是因为 QVMix 受 函数过高估计偏差的影响较小。
引用
@article{arxiv.2012.12062,
title = {QVMix and QVMix-Max: Extending the Deep Quality-Value Family of Algorithms to Cooperative Multi-Agent Reinforcement Learning},
author = {Pascal Leroy and Damien Ernst and Pierre Geurts and Gilles Louppe and Jonathan Pisane and Matthia Sabatelli},
journal= {arXiv preprint arXiv:2012.12062},
year = {2020}
}
备注
To be published in AAAI-21 Workshop on Reinforcement Learning in Games