尖锐极小值可泛化于深度网络
机器学习
2017-11-15 v2
摘要
尽管深度学习架构具有极强的过拟合能力,但它们往往能相当好地泛化到未见数据上,从而使其能够被实际部署。然而,解释为何如此仍然是一个开放的研究领域。一个日益流行的长期假设(例如 Hochreiter & Schmidhuber (1997); Keskar et al. (2017))认为,基于随机梯度的方法找到的损失函数极小值的平坦性导致了良好的泛化。本文论证了大多数关于平坦性的概念对于深度模型是有问题的,不能直接用于解释泛化。具体而言,当关注具有整流单元的深度网络时,我们可以利用这些架构所表现出的固有对称性所诱导的参数空间的特定几何结构,来构建对应于任意尖锐极小值的等价模型。此外,如果我们允许对函数进行重新参数化,其参数的几何结构可以在不影响其泛化性质的情况下发生剧烈变化。
引用
@article{arxiv.1703.04933,
title = {Sharp Minima Can Generalize For Deep Nets},
author = {Laurent Dinh and Razvan Pascanu and Samy Bengio and Yoshua Bengio},
journal= {arXiv preprint arXiv:1703.04933},
year = {2017}
}
备注
8.5 pages of main content, 2.5 of bibliography and 1 page of appendix