中文

ACE:具有双向动作依赖的协作多智能体 Q-learning

机器学习 2022-12-05 v2 多智能体系统

摘要

多智能体强化学习(MARL)受到非平稳性问题的困扰,即当多个智能体同时更新其策略时,每次迭代的目标都在不断变化。本文从第一性原理出发,通过提出双向动作依赖 Q-learning(ACE)来解决非平稳性问题。ACE 发展的核心在于顺序决策过程,其中每次仅允许一个智能体采取行动。在此过程中,每个智能体在推理阶段根据前面智能体已采取的行动最大化其价值函数。在学习阶段,每个智能体最小化依赖于后续智能体对其所选动作如何反应的 TD 误差。鉴于双向依赖的设计,ACE 有效地将多智能体 MDP 转化为单智能体 MDP。我们通过确定适当的网络表示来表述动作依赖,从而以一次前向传播隐式计算顺序决策过程,实现了 ACE 框架。为验证 ACE,我们在两个 MARL 基准上将其与强基线进行比较。实证实验表明,ACE 在 Google Research Football 和 StarCraft Multi-Agent Challenge 上大幅优于最先进的算法。特别是在 SMAC 任务上,ACE 在几乎所有困难及超困难地图上实现了 100% 成功率。我们进一步研究了关于 ACE 的广泛研究问题,包括扩展性、泛化性和实用性。代码已公开以促进进一步研究。

关键词

引用

@article{arxiv.2211.16068,
  title  = {ACE: Cooperative Multi-agent Q-learning with Bidirectional Action-Dependency},
  author = {Chuming Li and Jie Liu and Yinmin Zhang and Yuhong Wei and Yazhe Niu and Yaodong Yang and Yu Liu and Wanli Ouyang},
  journal= {arXiv preprint arXiv:2211.16068},
  year   = {2022}
}

备注

Accepted by the Thirty-Seventh AAAI Conference on Artificial Intelligence(AAAI2023)