通过 Mean-Field Actor-Critic 流学习均值场博弈
最优化与控制
2025-10-27 v2 机器学习
摘要
我们提出了 Mean-Field Actor-Critic (MFAC) flow,即一种用于求解 mean-field games (MFGs) 的 continuous-time learning dynamics,结合了 reinforcement learning 和 optimal transport 的技术。MFAC 框架通过受控 partial differential equations (PDEs) 主导的 coupled gradient-based updates,联合演化 control (actor)、value function (critic) 和 distribution 三个组件。核心创新是 Optimal Transport Geodesic Picard (OTGP) flow,它沿 Wasserstein-2 geodesic 将 distribution 驱动向 equilibrium。我们采用 Lyapunov functionals 进行严格收敛分析,建立了 MFAC flow 在合适 timescale 下的 global exponential convergence 结果。我们的结果突出了 actor、critic 和 distribution 组件之间的 algorithm 概念。数值实验说明了理论发现,展示了 MFAC 框架在计算 MFG equilibrium 中的有效性。
引用
@article{arxiv.2510.12180,
title = {Learning Mean-Field Games through Mean-Field Actor-Critic Flow},
author = {Mo Zhou and Haosheng Zhou and Ruimeng Hu},
journal= {arXiv preprint arXiv:2510.12180},
year = {2025}
}