基于 Goldstein 次微分的非凸损失函数投影随机梯度下降的定量收敛分析
最优化与控制
2025-10-06 v1 机器学习
摘要
随机梯度下降(SGD)是机器学习中大量工作的主要算法。在许多情况下,通过投影来实现约束,导致投影随机梯度算法。近年来,大量研究考察了在渐近和非渐近setting下针对非凸损失函数的投影 SGD 收敛性。针对通过 Moreau 包装函数测量的收敛,已提供了强有力的定量保证。然而,这些结果无法直接与无约束 SGD 的工作进行比较,因为 Moreau 包装构造会改变梯度。其他基于梯度映射的常见措施存在限制,即只有在采用方差缩减方法(如小批量)时,才能保证收敛。本文提出了一种针对紧凸凸集上非凸损失函数的投影 SGD 分析。通过由约束生成的 Goldstein 次微分到梯度的距离来测量收敛。我们提出的收敛准则直接归化为无约束情况下的常用准则,并且我们在不要求方差缩减的情况下获得收敛。我们得到了针对独立同分布(IID)或满足混合条件(-mixing)的数据的收敛结果。在这些情况下,我们推导出渐近收敛和 的非渐近界限,其中 为步数。在 IID 次高斯数据的情况下,我们获得了 almost sure 渐近收敛和高概率非渐近 界限。特别是,我们是首次为非凸损失函数的投影 SGD 提供非渐近高概率界限。
关键词
引用
@article{arxiv.2510.02735,
title = {Quantitative Convergence Analysis of Projected Stochastic Gradient Descent for Non-Convex Losses via the Goldstein Subdifferential},
author = {Yuping Zheng and Andrew Lamperski},
journal= {arXiv preprint arXiv:2510.02735},
year = {2025}
}
备注
40 pages, 2 figures, under review for 37th International Conference on Algorithmic Learning Theory