中文

为何两时序 Q 学习会收敛到不同的均场解?统一的收敛分析

最优化与控制 2024-05-30 v3

摘要

我们重访最初由 Angiuli 等人 \cite{angiuli2022unified} 引入的统一两时序 Q 学习算法。该算法通过调节均场分布和 Q 函数分别对应的两个学习率的比例,便可有效求解均场博弈(MFG)和均场控制(MFC)问题。本文提供该算法在固定学习率下产生 bifurcated 数值结果的全面理论解释。我们通过建立将连续时间均场问题与其离散时间 Q 函数对应关系的图谱,形成算法的基础。我们的关键贡献在于构建了一个集成均场分布和 Q 函数迭代的 Lyapunov 函数。该 Lyapunov 函数促成整个学习率范围内算法的统一收敛,从而为分析提供了统一框架。

关键词

引用

@article{arxiv.2404.04357,
  title  = {Why does the two-timescale Q-learning converge to different mean field solutions? A unified convergence analysis},
  author = {Jing An and Jianfeng Lu and Yue Wu and Yang Xiang},
  journal= {arXiv preprint arXiv:2404.04357},
  year   = {2024}
}

备注

34 pages. Updated version for submission. We added more numerical results and fixed several minor mistakes