刚度:神经网络泛化的一个新视角
机器学习
2020-03-17 v3 神经与进化计算
机器学习
摘要
在本文中,我们通过提出并研究神经网络刚度这一概念,对神经网络的泛化提出了新的视角。我们通过观察在一个样本上网络参数的一次小梯度步长对另一个样本损失的影响来度量网络的刚度。更高的刚度表明网络正在学习可泛化的特征。具体而言,我们研究了刚度如何依赖于 1) 类别归属,2) 数据点输入空间中的距离,3) 训练迭代次数,以及 4) 学习率。我们在 MNIST、FASHION MNIST 和 CIFAR-10/100 上使用全连接与卷积神经网络,以及一个基于 transformer 的 NLP 模型进行了实验。我们展示了刚度与泛化之间的联系,并观察到其对学习率的依赖。在 CIFAR-100 上训练时,刚度矩阵表现出一种粗粒度行为,表明模型对超类归属有所感知。此外,我们度量了两个数据点之间的刚度如何依赖于它们输入空间的相互距离,并建立了动态临界长度这一概念——即在此距离之下,基于某数据点的参数更新会影响其邻近点。
引用
@article{arxiv.1901.09491,
title = {Stiffness: A New Perspective on Generalization in Neural Networks},
author = {Stanislav Fort and Paweł Krzysztof Nowak and Stanislaw Jastrzebski and Srini Narayanan},
journal= {arXiv preprint arXiv:1901.09491},
year = {2020}
}
备注
Submitted for review