中文

神经网络大宽度的局限:深度高斯过程视角

机器学习 2021-11-09 v2 机器学习

摘要

大宽度极限近来成为深度学习研究的焦点:除计算可行性外,更宽的网络是否优于更窄的网络?回答此问题颇具挑战,因为常规网络随宽度增加表达能力,可能掩盖任何负面效应。本文通过神经网络向深度高斯过程(Deep GP)——一类包含神经网络的非参数层次模型——的推广,解耦容量与宽度。借此,我们旨在理解一旦常规神经网络对给定建模任务具备充足容量后,宽度如何影响它们。我们在 Deep GP 上的理论与实证结果表明大宽度可能对层次模型有害。令人惊讶的是,我们证明即便非参数 Deep GP 也收敛至高斯过程,在不增加表达能力的情况下 effectively 变得更浅。对应于数据自适应基函数混合的后验随宽度变得愈发不依赖数据。我们的尾部分析表明宽度与深度效应相反:深度强化模型的非高斯性,而宽度使模型愈发高斯。我们发现存在一个“甜点区”在极限 GP 行为阻碍适应性之前最大化测试性能,对非参数 Deep GP 发生于宽度 = 1 或宽度 = 2。这些结果对采用 L2 正则化(等价于参数上的高斯先验)训练的常规神经网络中的同一现象做出强预测:我们展示此类神经网络可能需要多达 500 - 1000 个隐藏单元以获得充足容量——取决于数据集——但进一步增宽会降低性能。

关键词

引用

@article{arxiv.2106.06529,
  title  = {The Limitations of Large Width in Neural Networks: A Deep Gaussian Process Perspective},
  author = {Geoff Pleiss and John P. Cunningham},
  journal= {arXiv preprint arXiv:2106.06529},
  year   = {2021}
}

备注

NeurIPS 2021