中文

使用平均场控制近似协作异构多智能体强化学习

机器学习 2022-05-10 v3 人工智能 计算机科学与博弈论 多智能体系统

摘要

平均场控制(MFC)是缓解协作多智能体强化学习(MARL)问题维度灾难的有效方法。本文考虑一个包含 NpopN_{\mathrm{pop}} 个异构智能体的集合,这些智能体可被划分为 KK 个类别,使得第 kk 类包含 NkN_k 个同质智能体。我们的目标是证明该异构系统的MARL问题可通过其对应的MFC问题得到近似保证。我们考虑了三种场景,其中所有智能体的奖励和转移动态分别被视为以下各项的函数:(1) 所有类别的联合状态和动作分布,(2) 每个类别的个体分布,以及 (3) 整个总体的边缘分布。我们证明,在这些情况下,KK 类MARL问题可由MFC近似,其误差分别为 e1=O(X+UNpopkNk)e_1=\mathcal{O}(\frac{\sqrt{|\mathcal{X}|}+\sqrt{|\mathcal{U}|}}{N_{\mathrm{pop}}}\sum_{k}\sqrt{N_k})e2=O([X+U]k1Nk)e_2=\mathcal{O}(\left[\sqrt{|\mathcal{X}|}+\sqrt{|\mathcal{U}|}\right]\sum_{k}\frac{1}{\sqrt{N_k}})e3=O([X+U][ANpopk[K]Nk+BNpop])e_3=\mathcal{O}\left(\left[\sqrt{|\mathcal{X}|}+\sqrt{|\mathcal{U}|}\right]\left[\frac{A}{N_{\mathrm{pop}}}\sum_{k\in[K]}\sqrt{N_k}+\frac{B}{\sqrt{N_{\mathrm{pop}}}}\right]\right),其中 A,BA, B 为常数,X,U|\mathcal{X}|,|\mathcal{U}| 是每个智能体状态空间和动作空间的大小。最后,我们设计了一种基于自然策略梯度(NPG)的算法,在上述三种情况下,该算法能够分别以 O(ej3)\mathcal{O}(e_j^{-3}) 的样本复杂度收敛到误差在 O(ej)\mathcal{O}(e_j) 内的最优MARL策略,其中 j{1,2,3}j\in\{1,2,3\}

关键词

引用

@article{arxiv.2109.04024,
  title  = {On the Approximation of Cooperative Heterogeneous Multi-Agent Reinforcement Learning (MARL) using Mean Field Control (MFC)},
  author = {Washim Uddin Mondal and Mridul Agarwal and Vaneet Aggarwal and Satish V. Ukkusuri},
  journal= {arXiv preprint arXiv:2109.04024},
  year   = {2022}
}

备注

46 pages