中文

策略梯度方法在 N 人一般和线性二次博弈中找到纳什均衡

最优化与控制 2022-08-16 v2 计算机科学与博弈论 机器学习 机器学习

摘要

我们考虑一个具有随机动力学且定义在有限时域上的一般和 N 人线性二次博弈,并证明了自然策略梯度方法全局收敛到纳什均衡。为了证明该方法的收敛性,我们需要系统中存在一定量的噪声。我们给出了一个条件,本质上是对噪声协方差关于模型参数的下界要求,以保证收敛。我们通过数值实验说明了我们的结果,表明即使在确定性设定下策略梯度方法可能不收敛的情形中,加入噪声也会导致收敛。

关键词

引用

@article{arxiv.2107.13090,
  title  = {Policy Gradient Methods Find the Nash Equilibrium in N-player General-sum Linear-quadratic Games},
  author = {Ben Hambly and Renyuan Xu and Huining Yang},
  journal= {arXiv preprint arXiv:2107.13090},
  year   = {2022}
}