中文

学习平均场博弈

最优化与控制 2021-10-12 v4

摘要

本文提出一种通用平均场博弈(GMFG)框架,用于大规模随机博弈中的同步学习与决策。它首先确立了该 GMFG 唯一纳什均衡的存在性,并说明将 Q-learning 与经典 MFG 中的不动点方法简单结合会产生不稳定算法。随后提出一种带 Boltzmann 策略的 Q-learning 算法(GMF-Q),并分析了其收敛性与计算复杂度。在重复广告拍卖问题上的实验表明,该 GMF-Q 算法在收敛与学习精度方面高效且鲁棒。此外,与现有的多智能体强化学习算法相比,其在收敛性、稳定性和学习能力上均更优。

关键词

引用

@article{arxiv.1901.09585,
  title  = {Learning Mean-Field Games},
  author = {Xin Guo and Anran Hu and Renyuan Xu and Junzi Zhang},
  journal= {arXiv preprint arXiv:1901.09585},
  year   = {2021}
}

备注

Published in NeurIPS 2019