理解贝叶斯神经网络中准确性与不确定性量化之间的权衡:架构与推断选择
机器学习
2025-06-18 v2 统计方法学
机器学习
摘要
随着现代神经网络变得越来越复杂,指定具有高预测性能和可靠不确定性量化的模型变得越来越具挑战性。尽管存在关于贝叶斯神经网络真实后验预测分布的一些有前景的理论结果,但即使是最常用的后验近似方法的特性也常受到质疑。计算负担和难以处理的后验暴露了不准确的贝叶斯神经网络于差 poor 准确性和不可靠的不确定性估计。近似贝叶斯推断旨在用一些更简单但可实现的分布来替换未知且难以处理的后验分布。现代深层模型的维度,加上不可识别性,使得马尔可夫链蒙特卡洛 (MCMC) 计算极其昂贵且无法完全探索多模态后验。另一方面,变分推断受益于改进的计算复杂度,但缺乏基于抽样推断的渐近保证,倾向于集中在单个模式周围。两种方法的性能高度依赖于架构选择;本文旨在通过考虑大宽度和超出样本数据中的计算成本、准确性和不确定性量化等不同情景来为此提供一些指导。为了改进后验探索,研究了不同的模型平均和集成技术,以及它们对预测性能的益处。在我们的实验中,变分推断总体上提供了比 MCMC 更好的不确定性量化;进一步地,变分近似的堆叠和集成在显著降低成本的同时,提供了与 MCMC 相当的准确性。
引用
@article{arxiv.2503.11808,
title = {Understanding the Trade-offs in Accuracy and Uncertainty Quantification: Architecture and Inference Choices in Bayesian Neural Networks},
author = {Alisa Sheinkman and Sara Wade},
journal= {arXiv preprint arXiv:2503.11808},
year = {2025}
}
备注
24 pages