非平稳状态下 SGD 从尖锐极小值的指数级逃逸效率
机器学习
2022-03-22 v2 最优化与控制
摘要
我们表明随机梯度下降(SGD)即使在达到平稳分布之前,也能以指数速度从尖锐极小值中逃逸。SGD 一直是各种机器学习任务事实上的标准训练算法。然而,为何 SGD 能从非凸目标函数(如神经网络的损失函数)中找到高度可泛化的参数,仍是一个开放问题。“逃逸效率”一直是解决该问题的一个引人注目的概念,它衡量 SGD 从可能具有较低泛化性能的尖锐极小值中逃逸的效率。尽管其重要,该概念仅限于 SGD 在足够更新后达到平稳分布时才成立。在本文中,我们通过引入动力系统的大偏差理论,发展了一种新理论来研究带高斯噪声的 SGD 的逃逸效率。基于该理论,我们证明了称为指数逃逸的快速从尖锐极小值逃逸发生在非平稳设定中,且不仅连续 SGD 成立,离散 SGD 也成立。该结果的一个关键概念是称为“陡度”的量,它描述了 SGD 在整个训练过程中的随机行为。我们的实验与我们的理论一致。
引用
@article{arxiv.2111.04004,
title = {Exponential escape efficiency of SGD from sharp minima in non-stationary regime},
author = {Hikaru Ibayashi and Masaaki Imaizumi},
journal= {arXiv preprint arXiv:2111.04004},
year = {2022}
}