中文

MCMARL:通过类别分布混合参数化值函数的多智能体强化学习

机器学习 2022-05-23 v2

摘要

在合作多智能体任务中,一组智能体通过采取动作、接收团队奖励并观测下一状态来与环境联合交互。交互过程中,环境与奖励的不确定性不可避免地导致长期回报的随机性,且随智能体数量增加该随机性会加剧。然而,此类随机性被大多数现有基于值的多智能体强化学习(MARL)方法忽略,它们仅对个体智能体与团队建模 Q 值的期望。相较于使用长期回报的期望,更优的是通过分布估计回报来直接建模随机性。受此启发,本文从分布视角提出一种新颖的基于值的 MARL 框架,即经由类别分布混合参数化值函数用于 MARL(MCMARL)。具体而言,我们用类别分布建模个体 Q 值与全局 Q 值。为整合类别分布,我们定义了分布的五种基本操作,使期望价值函数分解方法(如 VDN 和 QMIX)可推广至其 MCMARL 变体。我们进一步证明,我们的 MCMARL 框架关于分布期望满足分布-个体-全局-最大(DIGM)原理,从而保证了全局 Q 值与个体 Q 值中联合与个体贪婪动作选择的一致性。在经验上,我们在随机矩阵博弈及一组具挑战性的 StarCraft II 微操任务上评估 MCMARL,显示了我们框架的有效性。

关键词

引用

@article{arxiv.2202.10134,
  title  = {MCMARL: Parameterizing Value Function via Mixture of Categorical Distributions for Multi-Agent Reinforcement Learning},
  author = {Jian Zhao and Mingyu Yang and Youpeng Zhao and Xunhan Hu and Wengang Zhou and Jiangcheng Zhu and Houqiang Li},
  journal= {arXiv preprint arXiv:2202.10134},
  year   = {2022}
}