中文

基于局部性的分解式多智能体 Actor-Critic 算法实现多机器人协调学习

机器人学 2025-03-31 v2 人工智能

摘要

本文提出了一种新颖的协作型多智能体强化学习方法,称为基于局部性的分解式多智能体 Actor-Critic (Loc-FACMAC). 现有的 SOTA 算法(如 FACMAC)依赖于全局奖励信息,这在去中心化系统中可能无法准确反映单个机器人动作的质量. 我们将局部性概念引入评论家学习过程中,使得关联性强的机器人在训练期间形成分组. 同一分组内的机器人彼此影响更大,从而实现更精确的策略评估. 此外,我们构建了一个依赖图来捕捉机器人之间的关系,以促进分组过程. 该方法缓解了维度灾难问题,并防止机器人使用无关信息. 我们的方法通过聚焦局部奖励并利用基于分组的学习来提升训练效率和性能,从而改进了现有算法. 我们在三个环境中评估了 Loc-FACMAC 的性能:Hallway、Multi-cartpole 和 Bounded-Cooperative-Navigation. 我们探究了分组规模对性能的影响,并将结果与基线 MARL 算法(如 LOMAQ、FACMAC 和 QMIX)进行比较. 实验表明,若正确定义局部性结构,Loc-FACMAC 的性能可优于这些基线算法高达 108%,这表明在 Actor-Critic 框架中利用局部性结构能够提升 MARL 性能.

关键词

引用

@article{arxiv.2503.18816,
  title  = {Learning Multi-Robot Coordination through Locality-Based Factorized Multi-Agent Actor-Critic Algorithm},
  author = {Chak Lam Shek and Amrit Singh Bedi and Anjon Basak and Ellen Novoseller and Nick Waytowich and Priya Narayanan and Dinesh Manocha and Pratap Tokekar},
  journal= {arXiv preprint arXiv:2503.18816},
  year   = {2025}
}