从总体损失上的梯度流到随机梯度下降的学习
机器学习
2022-10-14 v1 人工智能
最优化与控制
摘要
随机梯度下降(SGD)一直是学习大规模非凸模型的首选方法。尽管对 SGD 何时生效的通用分析尚难捉摸,但近期在理解总体损失上梯度流(GF)的收敛性方面已取得诸多进展,部分归因于连续时间分析所带来的简洁性。本文的一个总体主题是:在假设总体损失上的 GF 收敛的前提下,给出 SGD 收敛的一般条件。我们建立这种联系的主要工具是一个一般的逆 Lyapunov 型定理,它意味着在 GF 收敛速率的温和假设下存在 Lyapunov 势。事实上,利用这些势,我们展示了 GF 收敛速率与底层目标几何性质之间的一一对应。当这些势进一步满足某些自界性质时,我们展示它们可用于为梯度下降(GD)和 SGD 提供收敛保证(即使 GF 与 GD/SGD 的路径相距甚远)。结果表明,这些自界假设在某种意义上也是 GD/SGD 生效所必需的。利用我们的框架,我们不仅对凸损失或满足 PL/KL 性质的目标等经典设定,而且对包括相位恢复、矩阵平方根等更复杂问题提供了 GD/SGD 的统一分析,并推广了 Chatterjee 2022 近期工作的结果。
引用
@article{arxiv.2210.06705,
title = {From Gradient Flow on Population Loss to Learning with Stochastic Gradient Descent},
author = {Satyen Kale and Jason D. Lee and Chris De Sa and Ayush Sekhari and Karthik Sridharan},
journal= {arXiv preprint arXiv:2210.06705},
year = {2022}
}