随机梯度下降-上升:统一理论与高效新方法
最优化与控制
2023-03-09 v3 机器学习
摘要
随机梯度下降-上升(SGDA)是解决各类机器学习任务中出现的极小极大优化和变分不等式问题(VIP)的最突出算法之一。该方法的成功催生了经典SGDA的若干高级扩展,包括任意采样、方差缩减、坐标随机化以及带压缩的分布式变体,这些变体在文献中尤其是近几年来被广泛研究。本文提出一个统一的收敛分析,涵盖大量随机梯度下降-上升方法,这些方法迄今需要不同的直觉、有不同的应用,并在不同社区中分别发展。我们统一框架的关键在于对随机估计的参数化假设。通过我们的通用理论框架,我们要么恢复了已知特例的最尖锐已知速率,要么收紧了它们。此外,为说明我们方法的灵活性,我们开发了SGDA的几个新变体,如新的方差缩减方法(L-SVRGDA)、带压缩的新分布式方法(QSGDA、DIANA-SGDA、VR-DIANA-SGDA)以及带坐标随机化的新方法(SEGA-SGDA)。尽管这些新方法的变体在求解最小化问题中已知,但它们从未被考虑或分析用于求解极小极大问题和VIP。我们还通过大量数值实验展示了新方法的最重要性质。
引用
@article{arxiv.2202.07262,
title = {Stochastic Gradient Descent-Ascent: Unified Theory and New Efficient Methods},
author = {Aleksandr Beznosikov and Eduard Gorbunov and Hugo Berard and Nicolas Loizou},
journal= {arXiv preprint arXiv:2202.07262},
year = {2023}
}
备注
AISTATS 2023. 65 pages, 5 figures, 3 tables. Changes in v2: new results were added (Theorem 2.5 and its corollaries), few typos were fixed, more clarifications were added. Changes in v3: AISTATS formatting was applied, small clarifications were added. Code: https://github.com/hugobb/sgda