中文

平均场控制(MFC)能否近似具有非均匀交互的协作式多智能体强化学习(MARL)?

机器学习 2022-06-02 v2 多智能体系统

摘要

平均场控制(MFC)是求解多智能体强化学习(MARL)问题的有力工具。近期研究表明,当种群规模较大且智能体可交换时,MFC 能很好地近似 MARL。遗憾的是,可交换性假设意味着所有智能体彼此均匀交互,这在许多实际场景中并不成立。在本文中,我们放宽可交换性假设,并通过任意双随机矩阵对智能体间交互建模。因此,在我们的框架中,不同智能体所“看到”的平均场是不同的。我们证明,若每个智能体的奖励是该智能体所看到的平均场的仿射函数,则可用其关联的 MFC 问题在误差 e=O(1N[X+U])e=\mathcal{O}(\frac{1}{\sqrt{N}}[\sqrt{|\mathcal{X}|} + \sqrt{|\mathcal{U}|}]) 内近似此类非均匀 MARL 问题,其中 NN 为种群规模,X|\mathcal{X}|U|\mathcal{U}| 分别为状态和动作空间大小。最后,我们开发了自然策略梯度(NPG)算法,可为非均匀 MARL 提供误差 O(max{e,ϵ})\mathcal{O}(\max\{e,\epsilon\})、对任意 ϵ>0\epsilon >0 样本复杂度为 O(ϵ3)\mathcal{O}(\epsilon^{-3}) 的解。

关键词

引用

@article{arxiv.2203.00035,
  title  = {Can Mean Field Control (MFC) Approximate Cooperative Multi Agent Reinforcement Learning (MARL) with Non-Uniform Interaction?},
  author = {Washim Uddin Mondal and Vaneet Aggarwal and Satish V. Ukkusuri},
  journal= {arXiv preprint arXiv:2203.00035},
  year   = {2022}
}