变分推断训练的贝叶斯双层神经网络的强大数定律
机器学习
2023-07-12 v1 概率论
统计理论
统计理论
摘要
我们对无限宽双层情形下贝叶斯神经网络的变分推断(VI)训练进行了严格分析。考虑一个带正则化的证据下界(ELBO)的回归问题,该下界分解为数据的期望对数似然与先验分布和变分后验之间的 Kullback-Leibler(KL)散度。通过对 KL 施加适当权重,我们证明了三种不同训练方案的大数定律:(i)利用重参数化技巧对多重高斯积分精确估计的理想情形,(ii)使用蒙特卡洛采样的 minibatch 方案,即通常所称的 Bayes by Backprop,以及(iii)我们提出的一种新的计算代价更低的算法,称为 Minimal VI。一个重要结果是所有方法均收敛到相同的平均场极限。最后,我们以数值方式说明了结果,并讨论了推导中心极限定理的必要性。
引用
@article{arxiv.2307.04779,
title = {Law of Large Numbers for Bayesian two-layer Neural Network trained with Variational Inference},
author = {Arnaud Descours and Tom Huix and Arnaud Guillin and Manon Michel and Éric Moulines and Boris Nectoux},
journal= {arXiv preprint arXiv:2307.04779},
year = {2023}
}