基于 Q-learning 的均值场控制用于合作多智能体强化学习:收敛性与复杂性分析
机器学习
2021-10-04 v6 最优化与控制
机器学习
摘要
多智能体强化学习(MARL)尽管流行且取得了经验上的成功,却受到维度灾难的困扰。本文建立了用均值场控制(MFC)方法近似合作 MARL 的数学框架,并表明近似误差为 。通过为值函数和 Q 函数建立适当形式的动态规划原理,提出了一种无模型的基于核的 Q-learning 算法(MFC-K-Q),该算法被证明对 MFC 问题具有线性收敛速率,这是 MARL 文献中的首例。进一步确立了 MFC-K-Q 的收敛速率和样本复杂性独立于智能体数量 ,从而在学习环境中为具有 个智能体的 MARL 问题提供了 的近似。针对网络交通拥堵问题的实证研究表明,当 较大时(例如当 ),MFC-K-Q 优于现有的 MARL 算法。
引用
@article{arxiv.2002.04131,
title = {Mean-Field Controls with Q-learning for Cooperative MARL: Convergence and Complexity Analysis},
author = {Haotian Gu and Xin Guo and Xiaoli Wei and Renyuan Xu},
journal= {arXiv preprint arXiv:2002.04131},
year = {2021}
}