均匀随机权重如何引发非均匀偏置:具有窄教师网络的典型插值神经网络泛化
机器学习
2025-02-18 v3 机器学习
摘要
背景。一个主要的理论难题是,为什么过参数化神经网络在训练至零损失(即它们对数据进行插值)时仍能良好泛化。通常,神经网络使用随机梯度下降 (SGD) 或其变体进行训练。然而,最近的实证研究考察了对数据进行插值的随机神经网络的泛化能力:该神经网络是从参数上看似均匀的先验中采样的,条件是该神经网络能完美分类训练集。有趣的是,这样的神经网络样本通常与 SGD 训练的神经网络泛化得一样好。贡献。我们证明,如果存在一个与标签一致的底层窄“教师神经网络”,则此类随机神经网络插值器通常能良好泛化。具体而言,我们表明,由于神经网络结构中的冗余,神经网络参数化上的这种“平坦”先验在神经网络函数上诱导了丰富的先验。特别是,这产生了一种对更简单函数的偏置,这些函数需要更少的相关参数来表示——从而使得学习所需的样本复杂度近似与教师网络的复杂度(粗略地说,即非冗余参数的数量)成正比,而非与学生网络的复杂度成正比。
引用
@article{arxiv.2402.06323,
title = {How Uniform Random Weights Induce Non-uniform Bias: Typical Interpolating Neural Networks Generalize with Narrow Teachers},
author = {Gon Buzaglo and Itamar Harel and Mor Shpigel Nacson and Alon Brutzkus and Nathan Srebro and Daniel Soudry},
journal= {arXiv preprint arXiv:2402.06323},
year = {2025}
}
备注
Clarified Appendix B.4