通过截断重尾噪声从 SGD 中消除尖锐极小值
机器学习
2022-05-12 v4 最优化与控制
概率论
机器学习
摘要
深度学习的经验成功常归因于 SGD 神秘地避免损失景观中尖锐局部极小值的能力,因为已知尖锐极小值会导致较差的泛化。最近,在许多深度学习任务中报道了重尾梯度噪声的经验证据,并且 Şimşekli (2019a,b) 表明在此类重尾梯度噪声存在下 SGD 可以逃离尖锐局部极小值,为该谜题提供了部分解答。在这项工作中,我们分析了一种流行的 SGD 变体,其中梯度在固定阈值之上被截断。我们表明它实现了更强的避免尖锐极小值的 notion:它可以从其训练轨迹中有效地完全消除尖锐局部极小值。我们刻画了由重尾噪声驱动的截断 SGD 的动力学。首先,我们表明截断阈值和吸引域宽度决定了从相关局部极小值首次逃离时间的阶。此外,当目标函数满足适当结构条件时,我们证明随着学习率减小,重尾截断 SGD 的动力学与从不访问任何尖锐极小值的连续时间马尔可夫链密切相关。在深度学习上的真实数据实验证实了我们的理论预测,即带梯度裁剪的重尾 SGD 找到了“更平坦”的局部极小值并实现了更好的泛化。
引用
@article{arxiv.2102.04297,
title = {Eliminating Sharp Minima from SGD with Truncated Heavy-tailed Noise},
author = {Xingyu Wang and Sewoong Oh and Chang-Han Rhee},
journal= {arXiv preprint arXiv:2102.04297},
year = {2022}
}
备注
Proceedings of 2022 International Conference on Learning Representations. 157 pages (12 pages for the main paper and 145 pages for the supplementary materials)