中文

学习平均场博弈的一般框架

机器学习 2023-01-05 v3 最优化与控制 机器学习

摘要

本文提出了一个一般平均场博弈(GMFG)框架,用于大规模群体随机博弈中的同步学习与决策。它首先建立了该 GMFG 唯一纳什均衡的存在性,并证明在经典 MFG 中将强化学习与不动点方法朴素结合会产生不稳定算法。随后提出了带平滑策略的基于值和基于策略的强化学习算法(分别为 GMF-V 和 GMF-P),并分析了其收敛性与计算复杂度。在一个均衡产品定价问题上的实验表明,GMF-V 和 GMF-P 的两个具体实例化 GMF-V-Q 和 GMF-P-TRPO(分别结合 Q-learning 和 TRPO)在 GMFG 设定中均高效且鲁棒。此外,与 NN 人设定中现有的多智能体强化学习算法相比,它们在收敛速度、准确率和稳定性上表现更优。

关键词

引用

@article{arxiv.2003.06069,
  title  = {A General Framework for Learning Mean-Field Games},
  author = {Xin Guo and Anran Hu and Renyuan Xu and Junzi Zhang},
  journal= {arXiv preprint arXiv:2003.06069},
  year   = {2023}
}

备注

Published in Mathematics of Operations Research