非平稳平均场博弈的无模型强化学习
系统与控制
2020-04-07 v1 系统与控制
摘要
在本文中,我们考虑一个有限时域、非平稳、具有大量同质参与者的平均场博弈(MFG),参与者序贯制定战略决策,其中每个参与者通过一个称为平均场状态的聚合群体状态受到其他参与者的影响。每个参与者拥有一个仅其自身可观测的私有类型,以及一个表示其他参与者类型的经验分布的平均场群体状态,该状态在所有参与者间共享。最近,文献[1]中的作者提供了一种序贯分解算法来计算此类博弈的平均场均衡(MFE),使得均衡策略的计算时间由之前的指数级降为线性级。在本文中,我们将其扩展到状态转移未知的情况,提出一种基于Expected Sarsa与策略梯度方法的强化学习算法,该算法通过同时学习博弈动态来学习MFE策略。我们使用信息物理安全实例说明了我们的结果。
引用
@article{arxiv.2004.02073,
title = {Model-free Reinforcement Learning for Non-stationary Mean Field Games},
author = {Rajesh K Mishra and Deepanshu Vasal and Sriram Vishwanath},
journal= {arXiv preprint arXiv:2004.02073},
year = {2020}
}
备注
7 pages, 2 figures