中文

为何更大未必更好:关于有限与无限神经网络

机器学习 2020-06-25 v3 机器学习

摘要

近期工作认为,可通过取通道数至无穷来理解神经网络的理论,此时输出变为高斯过程(GP)分布。然而,我们注意到无限贝叶斯神经网络缺乏真实神经网络行为的一个关键方面:仅由网络超参数决定的固定核意味着它们无法进行任何形式的表现学习。表现或等价地核学习的缺失导致灵活性降低从而性能更差,为文献中观察到的无限网络劣势表现(如 Novak 等 2019)提供了潜在解释。我们给出刻画有限深度线性网络中表现与表现学习的先验的解析结果。我们凭经验显示,用 SGD 训练的 SOTA 架构(如 ResNet)中的表现比对应无限网络所暗示的更接近我们的深度线性结果所暗示者。这促使引入一类新网络:带瓶颈的无限网络,其继承无限网络的理论易处理性,同时允许表现学习。

关键词

引用

@article{arxiv.1910.08013,
  title  = {Why bigger is not always better: on finite and infinite neural networks},
  author = {Laurence Aitchison},
  journal= {arXiv preprint arXiv:1910.08013},
  year   = {2020}
}