中文

确定多智能体策略梯度的方差

机器学习 2022-04-05 v3 人工智能 多智能体系统

摘要

策略梯度(PG)方法是流行的强化学习(RL)方法,其中常应用基线来降低梯度估计的方差。在多智能体RL(MARL)中,尽管PG定理可以自然推广,但多智能体PG(MAPG)方法的有效性随着梯度估计的方差随智能体数量快速增加而下降。本文对MAPG方法进行了严格分析,首先量化了智能体数量与智能体探索对MAPG估计器方差的贡献。基于此分析,我们推导出了达到最小方差的最优基线(OB)。与OB相比,我们度量了现有MARL算法(如原始MAPG和COMA)的超额方差。考虑到使用深度神经网络,我们还提出了OB的代理版本,可无缝插入MARL中任何现有的PG方法。在Multi-Agent MuJoCo和StarCraft挑战的基准上,我们的OB技术有效稳定了训练,并大幅提升了多智能体PPO和COMA算法的性能。

关键词

引用

@article{arxiv.2108.08612,
  title  = {Settling the Variance of Multi-Agent Policy Gradients},
  author = {Jakub Grudzien Kuba and Muning Wen and Yaodong Yang and Linghui Meng and Shangding Gu and Haifeng Zhang and David Henry Mguni and Jun Wang},
  journal= {arXiv preprint arXiv:2108.08612},
  year   = {2022}
}