SGD 训练的神经网络学习复杂度递增的分布
机器学习
2023-05-29 v2 无序系统与神经网络
统计力学
机器学习
摘要
深度神经网络即使在插值训练数据时也能良好泛化的能力已通过多种“简单性偏差”得到解释。这些理论假设神经网络通过首先学习简单函数(例如线性分类器),然后再学习更复杂的非线性函数,从而避免过拟合。同时,数据结构也被认为是良好泛化的关键要素,但其在简单性偏差中的作用尚不清楚。在此,我们表明使用随机梯度下降训练的神经网络最初利用其输入的低阶统计量(如均值和协方差)对输入进行分类,并在训练后期才利用高阶统计量。我们首先在一个可解的神经网络合成数据训练模型中证明这种分布简单性偏差(DSB)。我们在一系列在 CIFAR10 上训练的深度卷积网络和视觉 transformer 中实证展示了 DSB,并表明其在 ImageNet 上预训练的网络中甚至也成立。我们讨论了 DSB 与其他简单性偏差的关系,并考虑了其对学习中高斯普适性原理的启示。
引用
@article{arxiv.2211.11567,
title = {Neural networks trained with SGD learn distributions of increasing complexity},
author = {Maria Refinetti and Alessandro Ingrosso and Sebastian Goldt},
journal= {arXiv preprint arXiv:2211.11567},
year = {2023}
}
备注
Source code available at https://github.com/sgoldt/dist_inc_comp