深度线性网络的贝叶斯插值
机器学习
2023-05-16 v3 机器学习
概率论
摘要
刻画神经网络深度、宽度与数据集规模如何共同影响模型质量,是深度学习理论中的核心问题。我们在输出维度为一、采用零噪声贝叶斯推断(高斯权重先验、以均方误差为负对数似然)训练的线性网络这一特例下给出完整解答。对任意训练数据集、网络深度与隐藏层宽度,我们用 Meijer-G 函数(一类单复变量的亚纯特殊函数)给出了预测后验与贝叶斯模型证据的有限样本表达式。通过对这些 Meijer-G 函数的新颖渐近展开,一幅关于深度、宽度与数据集规模联合作用的新图景浮现出来。我们证明线性网络在无限深度下做出可证明的最优预测:具有数据无关先验的无限深线性网络的后验,与具有证据最大化数据依赖先验的浅层网络的后验相同。这给出了在先验被迫数据无关时偏好更深网络的合理性依据。此外,我们证明在数据无关先验下,宽线性网络中的贝叶斯模型证据在无限深度时最大化,阐明了增加深度对模型选择的有益作用。支撑我们结果的是一个新颖涌现的有效深度概念,由隐藏层数与数据点数之积除以网络宽度给出;它决定了大数极限下后验的结构。
引用
@article{arxiv.2212.14457,
title = {Bayesian Interpolation with Deep Linear Networks},
author = {Boris Hanin and Alexander Zlokapa},
journal= {arXiv preprint arXiv:2212.14457},
year = {2023}
}