中文

基于 Goldstein 次微分的非凸损失函数投影随机梯度下降的定量收敛分析

最优化与控制 2025-10-06 v1 机器学习

摘要

随机梯度下降(SGD)是机器学习中大量工作的主要算法。在许多情况下,通过投影来实现约束,导致投影随机梯度算法。近年来,大量研究考察了在渐近和非渐近setting下针对非凸损失函数的投影 SGD 收敛性。针对通过 Moreau 包装函数测量的收敛,已提供了强有力的定量保证。然而,这些结果无法直接与无约束 SGD 的工作进行比较,因为 Moreau 包装构造会改变梯度。其他基于梯度映射的常见措施存在限制,即只有在采用方差缩减方法(如小批量)时,才能保证收敛。本文提出了一种针对紧凸凸集上非凸损失函数的投影 SGD 分析。通过由约束生成的 Goldstein 次微分到梯度的距离来测量收敛。我们提出的收敛准则直接归化为无约束情况下的常用准则,并且我们在不要求方差缩减的情况下获得收敛。我们得到了针对独立同分布(IID)或满足混合条件(LL-mixing)的数据的收敛结果。在这些情况下,我们推导出渐近收敛和 O(N1/3)O(N^{-1/3}) 的非渐近界限,其中 NN 为步数。在 IID 次高斯数据的情况下,我们获得了 almost sure 渐近收敛和高概率非渐近 O(N1/5)O(N^{-1/5}) 界限。特别是,我们是首次为非凸损失函数的投影 SGD 提供非渐近高概率界限。

关键词

引用

@article{arxiv.2510.02735,
  title  = {Quantitative Convergence Analysis of Projected Stochastic Gradient Descent for Non-Convex Losses via the Goldstein Subdifferential},
  author = {Yuping Zheng and Andrew Lamperski},
  journal= {arXiv preprint arXiv:2510.02735},
  year   = {2025}
}

备注

40 pages, 2 figures, under review for 37th International Conference on Algorithmic Learning Theory