多通道贝叶斯深度卷积网络为高斯过程
机器学习
2020-08-24 v4 人工智能
机器学习
神经与进化计算
摘要
此前已确认宽全连接神经网络(FCNs)与高斯过程(GPs)之间的等价性。该等价性使得例如无需实例化 FCN,而通过评估相应的 GP,即可计算出本应由完全贝叶斯、无限宽训练后的 FCN 给出的测试集预测。本工作中,我们推导了多层卷积神经网络(CNNs)含池化层与不含池化层两种情形下的类似等价性,并在无可训练核的 GPs 上于 CIFAR10 取得了最优结果。我们还引入了一种蒙特卡洛方法来估计给定神经网络架构对应的 GP,即便在解析形式项数过多而计算不可行的情况下。令人惊讶的是,在无池化层时,含权重共享与不含权重共享的 CNNs 对应的 GPs 是相同的。因此,在有限通道 CNNs 中经随机梯度下降(SGD)训练有益的平移等变性,在无限通道极限的贝叶斯处理中保证不起作用——这是两种机制间在 FCN 情形下不存在的质性差异。我们通过实验确认,尽管在某些场景下 SGD 训练的有限 CNNs 性能随通道数增加接近其对应 GPs,但经细致调参的 SGD 训练 CNNs 可显著优于其对应 GPs,暗示相较完全贝叶斯参数估计,SGD 训练具有优势。
引用
@article{arxiv.1810.05148,
title = {Bayesian Deep Convolutional Networks with Many Channels are Gaussian Processes},
author = {Roman Novak and Lechao Xiao and Jaehoon Lee and Yasaman Bahri and Greg Yang and Jiri Hron and Daniel A. Abolafia and Jeffrey Pennington and Jascha Sohl-Dickstein},
journal= {arXiv preprint arXiv:1810.05148},
year = {2020}
}
备注
Published as a conference paper at ICLR 2019