中文

关于策略梯度方法在一般随机博弈中收敛到纳什均衡的研究

计算机科学与博弈论 2022-10-18 v1 机器学习 最优化与控制

摘要

随机博弈中的学习是一个众所周知的困难问题,因为除了彼此的策略决策外,博弈者还必须应对博弈本身随时间演化、且可能以非常复杂方式演化这一事实。因此,除特定类别的博弈(如势博弈或两人零和博弈)外,流行学习算法(如策略梯度及其变体)的收敛性质鲜为人知。有鉴于此,我们考察了策略梯度方法相对于纳什均衡策略的长时间行为,这些策略在类似于优化中所用充分性条件的意义下是二阶平稳(SOS)的。我们的第一个结果是 SOS 策略以高概率为局部吸引的,并且我们证明由 REINFORCE 算法提供梯度估计的策略梯度轨迹,若方法步长选取适当,可实现 O(1/n)\mathcal{O}(1/\sqrt{n}) 的距离平方收敛速率。随后,专门考察确定性纳什策略类,我们证明该速率可大幅改善,且事实上在此情形下策略梯度方法在有限次迭代内收敛。

关键词

引用

@article{arxiv.2210.08857,
  title  = {On the convergence of policy gradient methods to Nash equilibria in general stochastic games},
  author = {Angeliki Giannou and Kyriakos Lotidis and Panayotis Mertikopoulos and Emmanouil-Vasileios Vlatakis-Gkaragkounis},
  journal= {arXiv preprint arXiv:2210.08857},
  year   = {2022}
}

备注

43 pages, 2 tables; to appear in the proceedings of NeurIPS 2022