学习平均场博弈
最优化与控制
2021-10-12 v4
摘要
本文提出一种通用平均场博弈(GMFG)框架,用于大规模随机博弈中的同步学习与决策。它首先确立了该 GMFG 唯一纳什均衡的存在性,并说明将 Q-learning 与经典 MFG 中的不动点方法简单结合会产生不稳定算法。随后提出一种带 Boltzmann 策略的 Q-learning 算法(GMF-Q),并分析了其收敛性与计算复杂度。在重复广告拍卖问题上的实验表明,该 GMF-Q 算法在收敛与学习精度方面高效且鲁棒。此外,与现有的多智能体强化学习算法相比,其在收敛性、稳定性和学习能力上均更优。
引用
@article{arxiv.1901.09585,
title = {Learning Mean-Field Games},
author = {Xin Guo and Anran Hu and Renyuan Xu and Junzi Zhang},
journal= {arXiv preprint arXiv:1901.09585},
year = {2021}
}
备注
Published in NeurIPS 2019