中文

平坦性是伪友

机器学习 2020-06-17 v1 机器学习

摘要

基于 Hessian 的平坦性度量,如迹、Frobenius 范数和谱范数,已被论证、使用并证明与泛化相关。在本文中,我们证明对于交叉熵损失下的前馈神经网络,我们预期具有大权重的小损失解具有较小的基于 Hessian 的平坦性度量。这意味着使用 L2L2 正则化获得的解原则上应比未使用的更尖锐,尽管泛化更好。我们在 MNIST 和 CIFAR-100100 数据集上针对逻辑回归、多层感知机、简单卷积网络、预激活残差网络和宽残差网络证明了这一点。此外,我们表明,对于使用迭代平均的自适应优化算法,在 VGG-1616 网络和 CIFAR-100100 数据集上,其泛化优于 SGD,但尖锐度高 30×30 \times。这一理论发现连同实验结果,对基于 Hessian 的尖锐性度量在泛化讨论中的有效性提出了严重质疑。我们进一步表明,Hessian 秩可由常数乘以神经元数量再乘以类别数量所界定,这在实践中通常仅为网络参数的很小一部分。这解释了文献中报道的许多 Hessian 特征值要么为零要么非常接近零的奇特现象。

关键词

引用

@article{arxiv.2006.09091,
  title  = {Flatness is a False Friend},
  author = {Diego Granziol},
  journal= {arXiv preprint arXiv:2006.09091},
  year   = {2020}
}

备注

9 pages, 10 figures