中文

学习用于人工集体行为的分散式部分可观测平均场控制

机器学习 2024-02-26 v2 多智能体系统 最优化与控制

摘要

近期强化学习(RL)方法已在多个领域取得成功。然而,多智能体 RL(MARL)在分散化、部分可观测性以及面向大量智能体的可扩展性方面仍具挑战。与此同时,集体行为需要解决上述挑战,并且对主动物质物理、自组织系统、意见动力学以及生物或机器人集群等许多前沿应用至关重要。此处,通过平均场控制(MFC)的 MARL 为可扩展性提供了潜在方案,但未能考虑分散式与部分可观测系统。本文中,我们通过提出分散式部分可观测 MFC(Dec-POMFC)的新模型,使智能体在部分信息下实现分散行为;Dec-POMFC 是一类具有置换不变智能体的广泛问题,可归约为带单智能体 RL 解的可处理单智能体马尔可夫决策过程(MDP)。我们给出了严格的理论结果,包括动态规划原理,以及对应用于有限规模感兴趣集群的 Dec-POMFC 解的最优性保证。在算法上,我们提出了基于 Dec-POMFC、通过集中训练与分散执行的 MARL 策略梯度方法,并给出策略梯度近似保证。此外,我们通过核方法改进了最先进的基于直方图的 MFC,这本身对完全可观测 MFC 亦有独立意义。我们在如改进的 Kuramoto 与 Vicsek 集群模型等代表性集体行为任务上进行了数值评估,表现与最先进 MARL 相当。总体而言,我们的框架朝着基于 RL 的 MFC 人工集体行为工程迈出了一步。

关键词

引用

@article{arxiv.2307.06175,
  title  = {Learning Decentralized Partially Observable Mean Field Control for Artificial Collective Behavior},
  author = {Kai Cui and Sascha Hauck and Christian Fabian and Heinz Koeppl},
  journal= {arXiv preprint arXiv:2307.06175},
  year   = {2024}
}

备注

Accepted to ICLR 2024