中文

通过 Mean-Field Actor-Critic 流学习均值场博弈

最优化与控制 2025-10-27 v2 机器学习

摘要

我们提出了 Mean-Field Actor-Critic (MFAC) flow,即一种用于求解 mean-field games (MFGs) 的 continuous-time learning dynamics,结合了 reinforcement learning 和 optimal transport 的技术。MFAC 框架通过受控 partial differential equations (PDEs) 主导的 coupled gradient-based updates,联合演化 control (actor)、value function (critic) 和 distribution 三个组件。核心创新是 Optimal Transport Geodesic Picard (OTGP) flow,它沿 Wasserstein-2 geodesic 将 distribution 驱动向 equilibrium。我们采用 Lyapunov functionals 进行严格收敛分析,建立了 MFAC flow 在合适 timescale 下的 global exponential convergence 结果。我们的结果突出了 actor、critic 和 distribution 组件之间的 algorithm 概念。数值实验说明了理论发现,展示了 MFAC 框架在计算 MFG equilibrium 中的有效性。

关键词

引用

@article{arxiv.2510.12180,
  title  = {Learning Mean-Field Games through Mean-Field Actor-Critic Flow},
  author = {Mo Zhou and Haosheng Zhou and Ruimeng Hu},
  journal= {arXiv preprint arXiv:2510.12180},
  year   = {2025}
}