中文

深度学习时代可扩展贝叶斯推断:从高斯过程到深度神经网络

机器学习 2024-05-01 v1 机器学习

摘要

大型神经网络在大数据集上进行训练已成为机器学习中的主导范式。这些系统依赖于其参数的最大似然点估计,阻止其表达模型不确定性。这可能导致预测过于自信,并防止将深度学习模型用于顺序决策。本论文发展了可扩展的方法来为神经网络配备模型不确定性。特别是,我们利用线性化拉普拉斯近似来为预训练的神经网络提供其切线线性模型所提供的不确定性估计。这使得贝叶斯神经网络推断转化为共轭高斯线性模型中的贝叶斯推断问题。然而,其成本仍是网络参数或观察次数乘以输出维度的三次方。这在假设下都不可行。我们通过使用随机梯度下降(SGD)——深度学习的核心算法——在线性模型及其凸对偶(高斯过程)中执行后验抽样来解决此不可行性。这样,我们回到线性化神经网络,发现线性化拉普拉斯近似在现代深度学习实践中——包括随机优化、提前停止和归一化层——用于超参数学习时呈现出多种不兼容性。我们解决了这些问题,并构建了一个基于线性化神经网络的样本基于 EM 算法,用于可扩展超参数学习。我们将上述方法应用于在 Imagenet(120 万观察和1000个输出维度)上训练的 ResNet-50(2500 万参数)进行线性化神经网络推断。此外,我们将这些方法应用于估计使用深度图像先验网络获得的3D断层扫描重建的不确定性。

关键词

引用

@article{arxiv.2404.19157,
  title  = {Scalable Bayesian Inference in the Era of Deep Learning: From Gaussian Processes to Deep Neural Networks},
  author = {Javier Antoran},
  journal= {arXiv preprint arXiv:2404.19157},
  year   = {2024}
}

备注

PhD Thesis, University of Cambridge