中文

QR-MIX:用于合作多智能体强化学习的分布值函数分解

机器学习 2021-02-24 v5 多智能体系统 机器学习

摘要

在合作多智能体强化学习(MARL)及集中训练分散执行(CTDE)设定下,智能体局部且独立地观测并与环境交互。由于局部观测与随机采样,奖励与观测中的随机性导致长期回报的随机性。现有方法如值分解网络(VDN)与 QMIX 将长期回报的值估计为不含随机性信息的标量。我们提出的模型 QR-MIX 引入分位数回归,将联合状态-动作值建模为分布,将 QMIX 与隐式分位数网络(IQN)相结合。然而,QMIX 中的单调性限制了联合状态-动作值分布的表达,并可能在非单调情形下导致错误估计。因此,我们提出了一种灵活的损失函数以近似 QMIX 中的单调性。我们的模型不仅对回报的随机性更具容忍度,也对单调性约束的随机性更具容忍度。实验结果表明,QR-MIX 在星际争霸多智能体挑战(SMAC)环境中优于先前最先进的方法 QMIX。

关键词

引用

@article{arxiv.2009.04197,
  title  = {QR-MIX: Distributional Value Function Factorisation for Cooperative Multi-Agent Reinforcement Learning},
  author = {Jian Hu and Seth Austin Harding and Haibin Wu and Siyue Hu and Shih-wei Liao},
  journal= {arXiv preprint arXiv:2009.04197},
  year   = {2021}
}

备注

There are some experimental errors and experimental unfairness in this paper that will seriously affect the later studies