用于协作多智能体强化学习的分解软演员-评论家方法
人工智能
2021-05-11 v2 多智能体系统
机器学习
摘要
深度强化学习方法已在许多具有挑战性的协作多智能体任务上展现出优异性能。两个主要且有前景的研究方向是多智能体值函数分解与多智能体策略梯度。本文提出一种新的分解多智能体软演员-评论家(mSAC)方法,有效结合了上述两类方法的优势。其主要模块包括分解 Q 网络架构、离散概率策略与反事实优势函数(可选)。理论上,mSAC 支持高效的离策略学习,并在离散与连续动作空间中部分解决信用分配问题。在 StarCraft II 微操协作多智能体基准上,我们实证考察了 mSAC 相对于其变体的性能,并分析了不同组件的影响。实验结果表明,mSAC 显著优于基于策略的方法 COMA,并在渐近性能指标上于多数任务中与 SOTA 基于值的方法 Qmix 取得相当结果。此外,mSAC 在大型动作空间任务(如 2c_vs_64zg 与 MMM2)上取得了相当好的结果。
引用
@article{arxiv.2104.06655,
title = {Decomposed Soft Actor-Critic Method for Cooperative Multi-Agent Reinforcement Learning},
author = {Yuan Pu and Shaochen Wang and Rui Yang and Xin Yao and Bin Li},
journal= {arXiv preprint arXiv:2104.06655},
year = {2021}
}
备注
11 pages, 5 figures