中文

交替更新在极小极大优化中的根本优势

最优化与控制 2024-07-16 v2 机器学习

摘要

旨在解决极小极大优化问题的梯度下降 - 上升 (GDA) 算法,其下降步和上升步可以是同时进行的 (Sim-GDA) 或交替进行的 (Alt-GDA)。虽然通常观察到 Alt-GDA 收敛更快,但两者之间的性能差距在理论上尚未得到充分理解,特别是在全局收敛速率方面。为了弥合这一理论与实践的差距,我们对这两种算法在强凸 - 强凹及 Lipschitz 梯度目标函数下的收敛性进行了细粒度分析。我们得出的 Alt-GDA 新的迭代复杂度上界严格小于 Sim-GDA 的下界;即 Alt-GDA 被证明更快。此外,我们提出了交替外推 GDA (Alex-GDA),这是一个通用的算法框架,涵盖了 Sim-GDA 和 Alt-GDA,其主要思想是交替地对迭代点进行外推并取梯度。我们表明,Alex-GDA 满足更小的迭代复杂度界,与外梯度法 (Extra-gradient method) 相同,同时需要更少的梯度计算。我们还证明了 Alex-GDA 在双线性问题上享有线性收敛性,而 Sim-GDA 和 Alt-GDA 在这类问题上完全无法收敛。

关键词

引用

@article{arxiv.2402.10475,
  title  = {Fundamental Benefit of Alternating Updates in Minimax Optimization},
  author = {Jaewook Lee and Hanseul Cho and Chulhee Yun},
  journal= {arXiv preprint arXiv:2402.10475},
  year   = {2024}
}

备注

Accepted to ICML 2024 (Spotlight). 76 pages, 2 figures. Additional experiments (quadratic game, GAN) and proofs