中文

值分解多智能体Actor-Critic方法

人工智能 2020-12-21 v4 机器学习 多智能体系统

摘要

利用额外状态信息一直是多智能体强化学习(MARL)中的一个活跃研究领域。QMIX使用非负函数逼近器表示联合动作价值,并在多智能体基准测试——星际争霸II微操任务上取得了迄今为止的最佳性能。然而,我们的实验表明,在某些情况下,QMIX与A2C这一旨在提升算法训练效率的训练范式不兼容。为了在训练效率和算法性能之间取得合理的权衡,我们将值分解扩展到与A2C兼容的actor-critic方法,并提出了一种新颖的actor-critic框架,即值分解actor-critic(VDACs)。我们在星际争霸II微操任务测试平台上评估了VDACs,并证明所提出的框架相较于其他actor-critic方法提升了中位性能。此外,我们通过一组消融实验确定了影响VDACs性能的关键因素。

关键词

引用

@article{arxiv.2007.12306,
  title  = {Value-Decomposition Multi-Agent Actor-Critics},
  author = {Jianyu Su and Stephen Adams and Peter A. Beling},
  journal= {arXiv preprint arXiv:2007.12306},
  year   = {2020}
}

备注

Accepted by 35th AAAI Conference on Artificial Intelligence (AAAI 2021)