基于希尔伯特核心集的自动化可扩展贝叶斯推断
机器学习
2019-03-01 v2 机器学习
统计计算
摘要
贝叶斯数据分析中后验推断的自动化使专家和非专家都能使用更复杂的模型、进行更快的探索性建模和分析,并确保实验可重复性。然而,标准自动化后验推断算法在大规模现代数据集的规模下难以处理,而为此所做的修改通常是模型特定的、需要专家调参,并且可能破坏推断质量的理论保证。基于贝叶斯核心集框架,本文转而利用数据冗余,将数据集本身缩小作为预处理步骤,从而提供具有理论保证的全自动化、可扩展贝叶斯推断。我们首先将贝叶斯核心集构建直观地重新表述为稀疏向量和近似,并指出其自动化和基于性能的缺陷源于上确界范数的使用。为解决这些缺陷,我们开发了希尔伯特核心集(即在对数似然函数空间上由内积诱导的范数下构建的贝叶斯核心集)。我们提出了两种希尔伯特核心集构建算法——一种基于重要性采样,另一种基于Frank-Wolfe算法——以及关于近似质量作为核心集大小函数的理论保证。由于所提出内积的确切计算是模型特定的,我们通过对数似然函数的随机有限维投影来实现构建的自动化。所得到的自动化核心集构建算法易于实现,并且在带有真实和合成数据集的多种模型上的实验表明,它提供了高质量的后验近似并显著降低了推断的计算成本。
引用
@article{arxiv.1710.05053,
title = {Automated Scalable Bayesian Inference via Hilbert Coresets},
author = {Trevor Campbell and Tamara Broderick},
journal= {arXiv preprint arXiv:1710.05053},
year = {2019}
}