中文

带线性层的 ReLU 神经网络偏向于单指标与多指标模型

机器学习 2025-03-19 v4 机器学习

摘要

神经网络通常在过参数化 regime 下运行,其中参数远多于训练样本,从而可以完美拟合训练数据。也就是说,训练网络有效地学习了一个插值函数,而该插值函数的性质会影响网络对新样本的预测。本文探讨了深度大于两层的神经网络所学习的此类函数的性质。我们的框架考虑了一系列不同深度但容量相同、表示代价不同的网络。由神经网络架构诱导的函数的表示代价是该网络表示该函数所需的最小权重平方和;它反映了与该架构相关的函数空间偏置。我们的结果表明,在浅层 ReLU 网络的输入侧添加额外的线性层会产生一种表示代价,该代价偏好具有低混合变差的函数——即其在垂直于低维子空间的方向上变化有限,并且可以被单指标或多指标模型很好地近似。这种偏置之所以发生,是因为最小化线性层的权重平方和等价于最小化单个“虚拟”权重矩阵的低秩促进 Schatten 拟范数。我们的实验在标准网络训练 regime 中证实了这一行为。它们还表明,当数据使用多指标模型生成时,线性层能够改善泛化,并且学习到的网络与真实的潜在低维线性子空间良好对齐。

关键词

引用

@article{arxiv.2305.15598,
  title  = {ReLU Neural Networks with Linear Layers are Biased Towards Single- and Multi-Index Models},
  author = {Suzanna Parkinson and Greg Ongie and Rebecca Willett},
  journal= {arXiv preprint arXiv:2305.15598},
  year   = {2025}
}