值分解多智能体Actor-Critic方法
人工智能
2020-12-21 v4 机器学习
多智能体系统
摘要
利用额外状态信息一直是多智能体强化学习(MARL)中的一个活跃研究领域。QMIX使用非负函数逼近器表示联合动作价值,并在多智能体基准测试——星际争霸II微操任务上取得了迄今为止的最佳性能。然而,我们的实验表明,在某些情况下,QMIX与A2C这一旨在提升算法训练效率的训练范式不兼容。为了在训练效率和算法性能之间取得合理的权衡,我们将值分解扩展到与A2C兼容的actor-critic方法,并提出了一种新颖的actor-critic框架,即值分解actor-critic(VDACs)。我们在星际争霸II微操任务测试平台上评估了VDACs,并证明所提出的框架相较于其他actor-critic方法提升了中位性能。此外,我们通过一组消融实验确定了影响VDACs性能的关键因素。
引用
@article{arxiv.2007.12306,
title = {Value-Decomposition Multi-Agent Actor-Critics},
author = {Jianyu Su and Stephen Adams and Peter A. Beling},
journal= {arXiv preprint arXiv:2007.12306},
year = {2020}
}
备注
Accepted by 35th AAAI Conference on Artificial Intelligence (AAAI 2021)