中文

基于 Q-learning 的均值场控制用于合作多智能体强化学习:收敛性与复杂性分析

机器学习 2021-10-04 v6 最优化与控制 机器学习

摘要

多智能体强化学习(MARL)尽管流行且取得了经验上的成功,却受到维度灾难的困扰。本文建立了用均值场控制(MFC)方法近似合作 MARL 的数学框架,并表明近似误差为 O(1N)\mathcal{O}(\frac{1}{\sqrt{N}})。通过为值函数和 Q 函数建立适当形式的动态规划原理,提出了一种无模型的基于核的 Q-learning 算法(MFC-K-Q),该算法被证明对 MFC 问题具有线性收敛速率,这是 MARL 文献中的首例。进一步确立了 MFC-K-Q 的收敛速率和样本复杂性独立于智能体数量 NN,从而在学习环境中为具有 NN 个智能体的 MARL 问题提供了 O(1N)\mathcal{O}(\frac{1}{\sqrt{N}}) 的近似。针对网络交通拥堵问题的实证研究表明,当 NN 较大时(例如当 N>50N>50),MFC-K-Q 优于现有的 MARL 算法。

关键词

引用

@article{arxiv.2002.04131,
  title  = {Mean-Field Controls with Q-learning for Cooperative MARL: Convergence and Complexity Analysis},
  author = {Haotian Gu and Xin Guo and Xiaoli Wei and Renyuan Xu},
  journal= {arXiv preprint arXiv:2002.04131},
  year   = {2021}
}