平均场控制博弈的多时间尺度强化Q学习算法分析
最优化与控制
2024-06-05 v3 机器学习
多智能体系统
摘要
平均场控制博弈(MFCG)由[Angiuli等人,2022a]提出,代表了在群体数量和规模趋于无穷的极限下,大量大型协作群体之间的一种竞争博弈。在本文中,我们从代表性智能体的角度,证明了一种用于在无模型方法下求解MFCG的三时间尺度强化Q学习(RL)算法的收敛性。我们的分析使用了一个在无限时域上每个离散时间步更新的、针对有限状态和动作空间的Q表。在[Angiuli等人,2023]中,我们分别证明了用于MFG和MFC的双时间尺度算法的收敛性,突出了在MFC情况下需要跟踪多个群体分布。在这里,我们将这一特性整合到MFCG中,并引入了三个以适当比率递减至零的更新速率。我们的证明技术使用了[Borkar,1997]中双时间尺度分析到三时间尺度的推广。我们给出了一个满足收敛性证明中各种假设的简单示例,并展示了该算法的性能。
引用
@article{arxiv.2405.17017,
title = {Analysis of Multiscale Reinforcement Q-Learning Algorithms for Mean Field Control Games},
author = {Andrea Angiuli and Jean-Pierre Fouque and Mathieu Laurière and Mengrui Zhang},
journal= {arXiv preprint arXiv:2405.17017},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2312.06659