中文

正则化 Softmax 深度多智能体 $Q$ 学习

机器学习 2021-06-14 v2 多智能体系统

摘要

解决 QQ 学习中的过高估计是一个重要问题,在单智能体强化学习中已被广泛研究,但在多智能体设定中受到的关注相对较少。本工作中,我们通过实验证明,流行的协作多智能体强化学习(MARL)QQ 学习算法 QMIX 在实践中遭受比以往所认知更严重的过高估计,且现有方法无法缓解。我们以一种新的基于正则化的更新方案纠正此问题,该方案惩罚偏离基线的较大联合动作值,并证明其稳定学习的有效性。此外,我们提出采用 softmax 算子,并在多智能体设定中以一种新颖方式高效近似之,以进一步降低潜在的过高估计偏差。我们的方法——正则化 Softmax(RES)深度多智能体 QQ 学习——具有通用性,可应用于任何基于 QQ 学习的 MARL 算法。我们证明,当应用于 QMIX 时,RES 避免了严重过高估计并显著提升性能,在包括具挑战性的 StarCraft II 微操基准在内的多种协作多智能体任务中取得最先进结果。

关键词

引用

@article{arxiv.2103.11883,
  title  = {Regularized Softmax Deep Multi-Agent $Q$-Learning},
  author = {Ling Pan and Tabish Rashid and Bei Peng and Longbo Huang and Shimon Whiteson},
  journal= {arXiv preprint arXiv:2103.11883},
  year   = {2021}
}