面向高维均值场游戏的深层策略迭代:再生性重构方法
数值分析
2026-05-18 v2 数值分析
摘要
本文发展了一种用于高维有限时域均值场游戏(MFG)的深层策略迭代方法。我们将游戏重新表述为具有确定性循环的再生问题,这使得策略评估(PE)、策略改进(PI)和人口测度估计能够逐循环进行。在此表述下,我们通过粒子系统近似人口测度,并使用由状态动力学欧拉马约姆离散化诱导的单步骤随机映射进行更新。该更新将一小批粒子从一个循环输送到下一个循环,避免了在每次迭代中对整个时间范围内进行顺序轨迹模拟。PE和PI子问题通过连续循环之间的关系来表述,采用对抗训练进行评估,采用平均优化进行改进。最终的方法在高维情况下高效且可扩展,因为它避免了求解耦合的哈密顿-约翰逊-班花系统、估计人口测度的完整轨迹模拟、在策略评估中显式计算条件期望,以及在策略改进中进行点优化。数值实验表明,所提方法有效处理最高达10,000维的情况。
引用
@article{arxiv.2604.26782,
title = {Deep Policy Iteration for High-Dimensional Mean-Field Games with Regenerative Reformulation},
author = {Shuixin Fang and Shupeng Wang and Zhen Wu and Hui Zhang and Tao Zhou},
journal= {arXiv preprint arXiv:2604.26782},
year = {2026}
}
备注
31 pages, 6 figures