深度网络中平坦极小值的独特性质
机器学习
2020-08-11 v2 机器学习
摘要
众所周知,(随机)梯度下降对平坦极小值具有隐式偏好。在深度神经网络训练中,这一机制起到筛选极小值的作用。然而,这对训练后网络的确切影响尚不完全清楚。在本文中,我们刻画了用二次损失训练的线性神经网络中的平坦极小值。首先,我们证明零初始化的线性ResNet必然收敛到所有极小值中最平坦的一个。接着我们证明这些极小值对应于近乎平衡的网络,即从输入到任意中间表示的增益在各层之间不会发生剧烈变化。最后,我们证明平坦极小值解中的连续层是耦合的。即,每个权重矩阵的左奇异向量之一等于下一矩阵的右奇异向量之一。这形成了一条从输入到输出的独特路径,正如我们所展示的,该路径专用于经历最大端到端增益的信号。实验表明,这些性质是实际训练中线性与非线性模型共有的特征。
引用
@article{arxiv.2002.04710,
title = {Unique Properties of Flat Minima in Deep Networks},
author = {Rotem Mulayoff and Tomer Michaeli},
journal= {arXiv preprint arXiv:2002.04710},
year = {2020}
}
备注
Presented at ICML2020