中文

序贯零和线性二次动态博弈中策略梯度的全局收敛性

系统与控制 2019-11-13 v1 系统与控制 最优化与控制

摘要

我们提出针对线性二次动态博弈的无投影序贯算法。这些基于策略梯度的算法类似于 Stackelberg 领导模型,并可扩展至无模型设定。我们证明,若领导者执行自然梯度下降/上升,则所提算法具有至纳什均衡的全局次线性收敛性。此外,若领导者采用拟牛顿策略,该算法享有全局二次收敛性。在此过程中,我们考察并澄清了为 LQ 博弈采用序贯策略更新的复杂性,即有关稳定性、不定代价结构以及规避投影步骤的问题。

关键词

引用

@article{arxiv.1911.04672,
  title  = {Global Convergence of Policy Gradient for Sequential Zero-Sum Linear Quadratic Dynamic Games},
  author = {Jingjing Bu and Lillian J. Ratliff and Mehran Mesbahi},
  journal= {arXiv preprint arXiv:1911.04672},
  year   = {2019}
}