中文

Herding 类均场游戏中的学习:单环算法与有限时间收敛分析

最优化与控制 2025-02-13 v5

摘要

我们考虑离散时间平稳均场游戏 (MFG) ,其中动力学未知,并设计算法以在有限时间复杂度保证下寻找平衡。先前的解决方案假设均场最优一致性算子具有收敛性或严格弱单调性,这可能过于严苛。在本工作中,我们引入了一类可解 MFG,称为 "fully herding class",该类扩展了已知的可解 MFG 类,并首次包含具有多个平衡点的问题。我们提出了一种直接的政策优化方法,Accelerated Single-loop Actor Critic Algorithm for Mean Field Games (ASAC-MFG),该方法在合适的马尔可夫样本轨迹访问下,可在此类问题中找到全局平衡。与先前方法不同,ASAC-MFG 是单环和单样本路径。我们通过开发用于多时间尺度随机逼近的 new 技术,建立了 ASAC-MFG 到均场平衡的有限时间和有限样本收敛。我们通过具体的数值仿真支持了理论结果。当均场不影响转换和奖励时,MFG 降低为马尔可夫决策过程 (MDP),ASAC-MFG 成为寻找平均奖励 MDP 中最优政策的 actor-critic 算法,其样本复杂度匹配当前的最先进水平。先前的工作在 Bellman 算子上假设收敛,这对平均奖励 MDP 无效。我们在移除不可接受假设的同时匹配该收敛率,通过改进的 Lyapunov 函数实现。

关键词

引用

@article{arxiv.2408.04780,
  title  = {Learning in Herding Mean Field Games: Single-Loop Algorithm with Finite-Time Convergence Analysis},
  author = {Sihan Zeng and Sujay Bhatt and Alec Koppel and Sumitra Ganesh},
  journal= {arXiv preprint arXiv:2408.04780},
  year   = {2025}
}