学习平均场博弈的一般框架
机器学习
2023-01-05 v3 最优化与控制
机器学习
摘要
本文提出了一个一般平均场博弈(GMFG)框架,用于大规模群体随机博弈中的同步学习与决策。它首先建立了该 GMFG 唯一纳什均衡的存在性,并证明在经典 MFG 中将强化学习与不动点方法朴素结合会产生不稳定算法。随后提出了带平滑策略的基于值和基于策略的强化学习算法(分别为 GMF-V 和 GMF-P),并分析了其收敛性与计算复杂度。在一个均衡产品定价问题上的实验表明,GMF-V 和 GMF-P 的两个具体实例化 GMF-V-Q 和 GMF-P-TRPO(分别结合 Q-learning 和 TRPO)在 GMFG 设定中均高效且鲁棒。此外,与 人设定中现有的多智能体强化学习算法相比,它们在收敛速度、准确率和稳定性上表现更优。
引用
@article{arxiv.2003.06069,
title = {A General Framework for Learning Mean-Field Games},
author = {Xin Guo and Anran Hu and Renyuan Xu and Junzi Zhang},
journal= {arXiv preprint arXiv:2003.06069},
year = {2023}
}
备注
Published in Mathematics of Operations Research