中文

无限噪声方差下随机梯度下降的收敛速率

最优化与控制 2021-02-23 v1 机器学习

摘要

近期研究从经验和理论两方面表明,随机梯度下降(SGD)在多种场景下会出现重尾现象。此类重尾可能导致迭代量的方差发散,从而阻碍依赖二阶矩存在的常规收敛分析技术的使用。本文针对一类强凸目标,在具有潜在无限方差的状态依赖重尾噪声下,为SGD提供了收敛保证。当噪声的pp阶矩对某些p[1,2)p\in [1,2)存在时,我们首先确定了Hessian上的一个条件,称为“pp-正(半)定”,它在正半定矩阵(p=2p=2)与具有非负对角元素的对角占优矩阵(p=1p=1)之间产生了有趣的内插。在此条件下,我们进而给出了到全局最优解的LpL^p距离收敛速率。此外,我们给出了一个广义中心极限定理,表明适当缩放的Polyak-Ruppert平均弱收敛于多元α\alpha-稳定随机向量。我们的结果表明,即使在具有无限方差的重尾噪声下,SGD也能收敛到全局最优解,而无需像鲁棒统计中通常要求的那样对损失函数或算法本身做任何修改。我们展示了我们的结果对受重尾数据影响的线性回归和广义线性模型等应用的意义。

关键词

引用

@article{arxiv.2102.10346,
  title  = {Convergence Rates of Stochastic Gradient Descent under Infinite Noise Variance},
  author = {Hongjian Wang and Mert Gürbüzbalaban and Lingjiong Zhu and Umut Şimşekli and Murat A. Erdogdu},
  journal= {arXiv preprint arXiv:2102.10346},
  year   = {2021}
}