中文

零和与一般和双线性博弈中的乐观梯度下降上升法

最优化与控制 2022-11-24 v2

摘要

我们研究无约束双线性博弈中乐观梯度下降上升法(OGDA)的收敛性。第一部分考虑零和情形,推广了Daskalakis等人2018年、Liang与Stokes 2019年及其他人的先前结果:我们证明对任意收益矩阵,OGDA指数收敛到鞍点,并给出收敛的新且最优的几何比率。我们还刻画了诱导收敛的步长,并能推导出收敛速度的最优步长。第二部分,我们引入OGDA用于一般和双线性博弈:我们展示在一类有趣博弈中,要么OGDA指数快速收敛到纳什均衡,要么两参与者收益指数快速收敛到++\infty(可解释为用户间协调或合作的内生涌现)。我们还给出OGDA收敛到纳什均衡的充分条件。这些条件用于通过引入使用矩阵AA的Moore-Penrose逆矩阵的一般和博弈,来提升涉及矩阵AA的极小极大问题的收敛速度。据我们所知,这首次表明一般和博弈可用于最优改进为极小极大问题设计的算法。我们最后在生成对抗网络(Generative Adversarial Networks)的简单示例上说明了我们的结果。

关键词

引用

@article{arxiv.2208.03085,
  title  = {Optimistic Gradient Descent Ascent in Zero-Sum and General-Sum Bilinear Games},
  author = {Étienne de Montbrun and Jérôme Renault},
  journal= {arXiv preprint arXiv:2208.03085},
  year   = {2022}
}

备注

Complements the previous version: - Added proofs for the convergence for $\eta \leq \frac{1}{\sqrt{3\mu_{\max}}}$ instead of $\eta \leq \frac{1}{2\sqrt{\mu_{\max}}}$ - Show the importance of the Moore-Penrose inverse to speed up a Zero-Sum game