离线多智能体分解策略梯度
机器学习
2020-10-06 v2 多智能体系统
机器学习
摘要
多智能体策略梯度(MAPG)方法近期取得了蓬勃进展。然而,MAPG方法与最先进的多智能体基于值的方法之间存在显著的性能差距。本文研究了阻碍MAPG算法性能的原因,并提出了一种多智能体分解策略梯度方法(DOP)。该方法将值函数分解的思想引入多智能体Actor-Critic框架。基于此思想,DOP支持高效的离线学习,并解决了离散和连续动作空间中的集中-分散不匹配和信用分配问题。我们正式证明了DOP的评论家具有足够的表示能力以保证收敛。此外,在星际争霸II微操基准和多智能体粒子环境上的实证评估表明,DOP显著优于当前最先进的基于值和基于策略的多智能体强化学习算法。演示视频见 https://sites.google.com/view/dop-mapg/。
引用
@article{arxiv.2007.12322,
title = {Off-Policy Multi-Agent Decomposed Policy Gradients},
author = {Yihan Wang and Beining Han and Tonghan Wang and Heng Dong and Chongjie Zhang},
journal= {arXiv preprint arXiv:2007.12322},
year = {2020}
}