均匀化随机梯度下降中重尾现象的出现
机器学习
2024-02-05 v1 机器学习
摘要
人们反复观察到,通过随机梯度下降(SGD)进行损失最小化会导致神经网络参数呈现重尾分布。在此,我们分析了SGD的一种连续扩散近似,称为均匀化随机梯度下降,证明其行为是渐近重尾的,并给出了其尾指数的显式上界和下界。我们在数值实验中验证了这些界限,并表明它们通常是SGD迭代经验尾指数的近似值。此外,它们的显式形式使我们能够量化优化参数与尾指数之间的相互作用。通过这样做,我们为重尾与神经网络泛化性能之间联系以及SGD避免次优局部极小值能力的持续讨论做出了贡献。
引用
@article{arxiv.2402.01382,
title = {Emergence of heavy tails in homogenized stochastic gradient descent},
author = {Zhe Jiao and Martin Keller-Ressel},
journal= {arXiv preprint arXiv:2402.01382},
year = {2024}
}