中文

存在不可分解共享全局状态时基于平均场控制的多智能体强化学习近似

机器学习 2023-05-30 v2 人工智能 多智能体系统

摘要

平均场控制(MFC)是解决大规模多智能体强化学习(MARL)问题的强大近似工具。然而,MFC 的成功依赖于一个假设:给定所有智能体的局部状态和动作,智能体的下一个(局部)状态演化是条件独立的。本文表明,即使在 MARL 环境中,除了条件独立演化的局部状态外,智能体还共享一个公共全局状态(从而在各个智能体的状态转移过程之间引入相关性),MFC 仍然可以作为良好的近似工具加以应用。该全局状态被假设为不可分解的,即它不能表示为智能体局部状态的集合。我们将近似误差计算为 O(e)\mathcal{O}(e),其中 e=1N[X+U]e=\frac{1}{\sqrt{N}}\left[\sqrt{|\mathcal{X}|} +\sqrt{|\mathcal{U}|}\right]NN 表示智能体种群规模,X,U|\mathcal{X}|, |\mathcal{U}| 分别表示单个智能体的(局部)状态空间和动作空间的大小。研究发现,该近似误差与共享全局状态空间的大小无关。我们进一步证明,在一种特殊情况下,如果奖励和状态转移函数与种群的动作分布无关,则误差可以改进为 e=XNe=\frac{\sqrt{|\mathcal{X}|}}{\sqrt{N}}。最后,我们设计了一种基于自然策略梯度的算法,该算法以 O(ϵ3)\mathcal{O}(\epsilon^{-3}) 的样本复杂度求解 MFC 问题,并对于任意 ϵ>0\epsilon>0,获得与最优 MARL 策略误差在 O(max{e,ϵ})\mathcal{O}(\max\{e,\epsilon\}) 以内的策略。

关键词

引用

@article{arxiv.2301.06889,
  title  = {Mean-Field Control based Approximation of Multi-Agent Reinforcement Learning in Presence of a Non-decomposable Shared Global State},
  author = {Washim Uddin Mondal and Vaneet Aggarwal and Satish V. Ukkusuri},
  journal= {arXiv preprint arXiv:2301.06889},
  year   = {2023}
}