论深度神经网络对最小深度的隐式偏置
机器学习
2022-09-29 v9
摘要
文献中近期结果表明,为分类训练的神经网络的倒数第二(penultimate)层表示展现出一种称为神经崩溃(NC)的聚类特性。我们研究随机梯度下降(SGD)在训练深度神经网络时对低深度解的隐式偏置。我们刻画了有效深度的概念,其度量样本嵌入使用最近类中心分类器可分离的第一层。此外,我们假设并经验性地表明SGD隐式选择小有效深度的神经网络。其次,尽管神经崩溃甚至在泛化应不可能时出现——我们认为中间层的分离程度与泛化相关。我们推导出一个泛化界,基于将网络的有效深度与拟合相同含部分损坏标签数据集所需的最小深度进行比较。值得注意的是,该界提供了测试性能的非平凡估计。最后,我们经验性地表明训练好的神经网络的有效深度随数据中随机标签数量增加而单调增加。
引用
@article{arxiv.2202.09028,
title = {On the Implicit Bias Towards Minimal Depth of Deep Neural Networks},
author = {Tomer Galanti and Liane Galanti and Ido Ben-Shaul},
journal= {arXiv preprint arXiv:2202.09028},
year = {2022}
}