中文

面向高维平均场博弈的深度策略迭代

最优化与控制 2024-07-15 v4

摘要

本文提出深度策略迭代 (DPI),一种将神经网络的优势与策略迭代 (PI) 的稳定性和收敛性优势相结合以解决高维随机平均场博弈 (MFG) 的新方法。DPI 通过迭代训练三个神经网络来求解 PI 方程并满足前向-后向条件,克服了 PI 受维数灾难限制仅能处理低维问题的局限。我们的结果表明,DPI 达到了与平均场深度 Galerkin 方法 (MFDGM) 相当的收敛水平,并具有额外优势。此外,深度学习技术在处理 PI 单独效果不佳的可分离哈密顿量情形中展现出潜力。DPI 有效处理高维问题,将 PI 的适用性扩展至可分离与不可分离哈密顿量。

关键词

引用

@article{arxiv.2310.10827,
  title  = {Deep Policy Iteration for High-Dimensional Mean Field Games},
  author = {Mouhcine Assouli and Badr Missaoui},
  journal= {arXiv preprint arXiv:2310.10827},
  year   = {2024}
}