非光滑非凸函数常数步长随机梯度下降的收敛性
数值分析
2022-04-13 v3 数值分析
最优化与控制
摘要
本文研究常数步长随机梯度下降(SGD)在最小化未知函数 F 时的渐近行为,其中 F 定义为一个非凸、非光滑、局部Lipschitz随机函数的期望。由于梯度可能不存在,它被某个算子所替代:一个合理的选择是使用随机函数Clarke次微分中的一个元素;另一选择是著名的反向传播算法的输出,该算法在实践者中很流行,其性质近来由Bolte和Pauwels [7]研究。由于所选算子的期望一般不是平均函数Clarke次微分 BF 中的元素,文献中假设可获得 BF 的预言机。作为第一个结果,本文表明对于算法的几乎所有初始化点,这样的预言机是不需要的。接着,在小步长 regime下,表明算法的插值轨迹在概率上(以紧收敛意义)收敛到微分包含的解集合。最后,将迭代视为一个转移核由步长索引的马尔可夫链,表明当步长趋于零时,该核的不变分布弱收敛到该微分包含的不变分布集合。这些结果表明当步长较小时,以大概率迭代最终落在平均函数 F 的临界点邻域内。
引用
@article{arxiv.2005.08513,
title = {Convergence of constant step stochastic gradient descent for non-smooth non-convex functions},
author = {Pascal Bianchi and Walid Hachem and Sholom Schechtman},
journal= {arXiv preprint arXiv:2005.08513},
year = {2022}
}