以平滑与随机梯度应对良性非凸性
机器学习
2022-02-21 v1 机器学习
摘要
非凸优化问题在机器学习中无处不在,尤其在深度学习中。尽管此类复杂问题常可借助随机梯度下降(SGD)在实践中成功优化,理论分析却无法充分解释这一成功。特别是,标准分析未能展示SGD在非凸函数上的全局收敛,而是展示到驻点(也可能为局部极小或鞍点)的收敛。我们界定了一类宽泛的非凸函数,可证明扰动SGD(被随机噪声扰动的梯度下降——涵盖SGD作为特例)收敛到全局最小值(或其邻域),而无噪声的梯度下降会陷入远离全局解的局部极小。例如,在接近类凸(强凸或PL)函数的非凸函数上,我们证明SGD可线性收敛到全局最优。
引用
@article{arxiv.2202.09052,
title = {Tackling benign nonconvexity with smoothing and stochastic gradients},
author = {Harsh Vardhan and Sebastian U. Stich},
journal= {arXiv preprint arXiv:2202.09052},
year = {2022}
}