中文

深度网络中的低秩简并偏置

机器学习 2023-03-24 v4 计算机视觉与模式识别

摘要

现代深度神经网络相较于其训练数据高度过参数化,却常能惊人地良好泛化。近期大量工作追问:为何深度网络不会过拟合其训练数据?本工作中,我们进行了一系列实证观察,考察并扩展了如下假设:更深的网络具有归纳偏置,以寻找具有更低有效秩嵌入的解。我们猜想,此偏置存在是因为映射到低有效秩嵌入的函数体积随深度增加而增大。我们从经验上表明,该主张在有限宽度线性与非线性模型的实际学习范式上成立,并表明在自然数据上,这些往往正是泛化良好的解。我们进而表明,该简并偏置在初始化时与训练后均存在,且对超参数与学习方法具有鲁棒性。我们进一步演示了深度非线性模型的线性过参数化如何被用于诱导低秩偏置,在 CIFAR 与 ImageNet 上无需改变建模容量即可提升泛化性能。

关键词

引用

@article{arxiv.2103.10427,
  title  = {The Low-Rank Simplicity Bias in Deep Networks},
  author = {Minyoung Huh and Hossein Mobahi and Richard Zhang and Brian Cheung and Pulkit Agrawal and Phillip Isola},
  journal= {arXiv preprint arXiv:2103.10427},
  year   = {2023}
}