中文

针对连续时间线性-二次图ón均值场游戏的策略优化

最优化与控制 2025-06-09 v1 机器学习 概率论

摘要

尽管多智能体强化学习因其流行和实证成功而备受青睐,但在大规模动态游戏中面临显著的可扩展性挑战。图ón均值场游戏(GMFG)提供了一种原则性的框架,用于近似此类游戏,同时捕捉玩家之间的异质性。本文提出并分析了一种针对连续时间、有限时域线性-二次GMFG的策略优化框架。利用GMFG的结构属性,我们设计了一种高效的策略参数化方式,其中每个玩家的策略表示为其私有状态的仿射函数,共享斜率函数且具有玩家特定的截距。我们开发了一个双层优化算法,在固定人口分布下交替进行基于策略梯度的最佳响应计算,以及基于所得策略的分布更新。我们证明了策略梯度步骤对最佳响应策略的线性收敛,并建立了整个算法收敛于纳什均衡的全局收敛性。分析依赖于对无限维策略空间上新颖的景观特征描述。数值实验表明,在不同图ón结构、噪声水平和动作频率下,所提算法具有良好的收敛性和鲁棒性。

关键词

引用

@article{arxiv.2506.05894,
  title  = {Policy Optimization for Continuous-time Linear-Quadratic Graphon Mean Field Games},
  author = {Philipp Plank and Yufei Zhang},
  journal= {arXiv preprint arXiv:2506.05894},
  year   = {2025}
}