中文

平均场博弈与控制问题的统一强化 Q-学习

最优化与控制 2021-06-01 v3 机器学习 多智能体系统

摘要

我们提出一种强化学习(RL)算法来求解无限 horizon 渐近平均场博弈(MFG)和平均场控制(MFC)问题。我们的方法可描述为一种统一双时间尺度平均场 Q-学习:通过简单调节两个学习参数的比率,同一算法可以学习 MFG 或 MFC 解。该算法在离散时间和空间中,其中智能体不仅向环境提供动作,还提供状态的分布,以考虑问题的平均场特征。重要的是,我们假设智能体无法观测群体分布,需要以无模型方式估计它。渐近 MFG 和 MFC 问题也在连续时间和空间中给出,并与经典(非渐近或平稳)MFG 和 MFC 问题进行比较。它们在线性二次(LQ)情形下导出显式解,用作我们算法结果的基准。

关键词

引用

@article{arxiv.2006.13912,
  title  = {Unified Reinforcement Q-Learning for Mean Field Game and Control Problems},
  author = {Andrea Angiuli and Jean-Pierre Fouque and Mathieu Laurière},
  journal= {arXiv preprint arXiv:2006.13912},
  year   = {2021}
}