中文

用于平均场博弈与控制问题的多尺度强化Q学习算法的收敛性

最优化与控制 2024-05-02 v2

摘要

我们建立了 Angiuli 等人先前工作中提出的统一双时间尺度强化学习(RL)算法的收敛性。该算法根据两个学习率(一个用于值函数,另一个用于平均场项)的比率,为平均场博弈(MFG)或平均场控制(MFC)问题提供解决方案。我们的收敛性证明强调了这样一个事实:在 MFC 情况下,需要更新多个平均场分布,因此我们提出了两种独立的算法,一种用于 MFG,一种用于 MFC。我们专注于具有有限状态和动作空间、离散时间和无限时域的设置。收敛性证明依赖于对 Borkar 双时间尺度方法的推广。对真实解的近似精度取决于策略的平滑性。我们提供了一个数值示例来说明收敛性。

关键词

引用

@article{arxiv.2312.06659,
  title  = {Convergence of Multi-Scale Reinforcement Q-Learning Algorithms for Mean Field Game and Control Problems},
  author = {Andrea Angiuli and Jean-Pierre Fouque and Mathieu Laurière and Mengrui Zhang},
  journal= {arXiv preprint arXiv:2312.06659},
  year   = {2024}
}