中文

连续时间线性二次型平均场控制/博弈中策略梯度的全局收敛性

最优化与控制 2020-08-18 v1 机器学习

摘要

强化学习是通过与环境交互来学习可能多个智能体最优策略的有力工具。当智能体数量变得非常大时,系统可近似为一个平均场问题。因此,这催生了平均场控制(MFC)与平均场博弈(MFG)的新研究方向。本文研究线性二次型平均场控制与博弈的策略梯度方法,其中假设每个智能体具有相同的线性状态转移与二次型代价函数。尽管近期关于 MFC 与 MFG 策略梯度的工作多基于离散时间模型,我们聚焦于连续时间模型,其中某些分析技巧对读者而言或有意趣。对于 MFC 与 MFG,我们给出策略梯度更新并证明其以线性速率收敛至最优解,这由一项合成仿真所验证。对于 MFG,我们还给出纳什均衡存在性与唯一性的充分条件。

关键词

引用

@article{arxiv.2008.06845,
  title  = {Global Convergence of Policy Gradient for Linear-Quadratic Mean-Field Control/Game in Continuous Time},
  author = {Weichen Wang and Jiequn Han and Zhuoran Yang and Zhaoran Wang},
  journal= {arXiv preprint arXiv:2008.06845},
  year   = {2020}
}

备注

28 pages, 3 figures