中文

局部性至关重要:一种用于协作多智能体强化学习的可扩展值分解方法

人工智能 2021-09-23 v1 机器学习 多智能体系统 系统与控制 系统与控制 机器学习

摘要

协作多智能体强化学习(MARL)因状态和动作空间随智能体数量呈指数增长而面临显著的可扩展性问题。随着环境规模增大,有效的信用分配变得愈发困难,并常导致不可行的学习时长。然而,在许多真实场景中,存在可简化的底层动力学,可用于获得更具可扩展性的解。本工作中,我们在保持全局协作的同时有效利用此类局部性结构。我们提出一种名为LOMAQ的基于值的新型多智能体算法,其在集中训练分散执行范式中引入局部奖励。此外,我们提供一种直接的奖励分解方法,用于在仅提供全局信号时求得这些局部奖励。我们通过实验测试所提方法,表明其相较其他方法具有良好可扩展性,并显著提升了性能与收敛速度。

关键词

引用

@article{arxiv.2109.10632,
  title  = {Locality Matters: A Scalable Value Decomposition Approach for Cooperative Multi-Agent Reinforcement Learning},
  author = {Roy Zohar and Shie Mannor and Guy Tennenholtz},
  journal= {arXiv preprint arXiv:2109.10632},
  year   = {2021}
}