更紧致的神经网络风险证书
摘要
本文呈现了一项关于使用源自PAC-Bayes边界的训练目标来训练概率神经网络的实证研究。在概率神经网络的背景下,训练的输出是网络权重上的一个概率分布。我们提出了两个训练目标,这是它们首次被用于训练神经网络。这两个训练目标源自紧致的PAC-Bayes边界。我们还重新实现了一个先前使用的、基于经典PAC-Bayes边界的训练目标,以比较使用不同训练目标学习到的预测器的性质。我们基于用于学习预测器的部分数据,为学习到的预测器计算风险证书。我们进一步实验了不同类型的权重先验(包括无数据先验和数据依赖先验)以及神经网络架构。我们在MNIST和CIFAR-10上的实验表明,我们的训练方法产生了具有竞争力的测试集误差和非空的风险边界,其值比文献中先前的结果紧致得多,这不仅显示了通过界定风险来指导学习算法的潜力,也显示了其在模型选择方面的潜力。这些观察结果表明,这里研究的方法可能是自认证学习的有力候选者,即使用整个数据集来学习一个预测器,并认证其在任何未见数据(与训练数据同分布)上的风险,而可能无需保留测试数据。
引用
@article{arxiv.2007.12911,
title = {Tighter risk certificates for neural networks},
author = {María Pérez-Ortiz and Omar Rivasplata and John Shawe-Taylor and Csaba Szepesvári},
journal= {arXiv preprint arXiv:2007.12911},
year = {2021}
}
备注
New version includes: i) experiment showing the potential of the risk certificate for neural architecture search (Fig. 2); ii) experiments spanning uncertainty quantification and analysis of prior/posterior (Section 7.8); iii) an outline of the strengths of probabilistic neural networks trained by PBB (Section 7.9) and iv) a strengthened discussion on the connection to Bayesian learning