平均场控制(MFC)能否近似具有非均匀交互的协作式多智能体强化学习(MARL)?
机器学习
2022-06-02 v2 多智能体系统
摘要
平均场控制(MFC)是求解多智能体强化学习(MARL)问题的有力工具。近期研究表明,当种群规模较大且智能体可交换时,MFC 能很好地近似 MARL。遗憾的是,可交换性假设意味着所有智能体彼此均匀交互,这在许多实际场景中并不成立。在本文中,我们放宽可交换性假设,并通过任意双随机矩阵对智能体间交互建模。因此,在我们的框架中,不同智能体所“看到”的平均场是不同的。我们证明,若每个智能体的奖励是该智能体所看到的平均场的仿射函数,则可用其关联的 MFC 问题在误差 内近似此类非均匀 MARL 问题,其中 为种群规模,、 分别为状态和动作空间大小。最后,我们开发了自然策略梯度(NPG)算法,可为非均匀 MARL 提供误差 、对任意 样本复杂度为 的解。
引用
@article{arxiv.2203.00035,
title = {Can Mean Field Control (MFC) Approximate Cooperative Multi Agent Reinforcement Learning (MARL) with Non-Uniform Interaction?},
author = {Washim Uddin Mondal and Vaneet Aggarwal and Satish V. Ukkusuri},
journal= {arXiv preprint arXiv:2203.00035},
year = {2022}
}