NQMIX:面向深度多智能体强化学习的非单调值函数分解
人工智能
2021-07-14 v4 多智能体系统
摘要
基于多智能体值函数的方法近来取得重大进展,尤其是值分解方法。然而,值函数分解仍存在诸多局限。在VDN中,联合动作值函数是各智能体动作值函数之和,而QMIX的联合动作值函数是各智能体动作值函数的单调混合。在某种程度上,QTRAN降低了可表示联合动作值函数的局限性,但其在复杂任务中表现不佳。本文为扩展可表示的联合值函数类别,提出一种称为NQMIX的新型actor-critic方法。NQMIX在QMIX上引入离策略策略梯度并修改其网络架构,从而可去除QMIX的单调性约束,实现联合动作值函数的非单调值函数分解。此外,NQMIX以状态值为学习目标,克服了QMIX中学习目标被高估的问题。进一步地,NQMIX可通过在其上引入确定性策略梯度扩展至连续动作空间设定。最后,我们在SMAC域上评估所提actor-critic方法,表明其在具有异构智能体类型的复杂地图上比COMA和QMIX性能更强。此外,消融实验结果表明我们对混合网络的修改是有效的。
引用
@article{arxiv.2104.01939,
title = {NQMIX: Non-monotonic Value Function Factorization for Deep Multi-Agent Reinforcement Learning},
author = {Quanlin Chen},
journal= {arXiv preprint arXiv:2104.01939},
year = {2021}
}