β-Cores:存在离群点时的鲁棒大规模贝叶斯数据摘要方法
机器学习
2020-11-10 v2 人工智能
应用统计
机器学习
摘要
现代机器学习应用应能够应对在海量真实世界数据集上进行推断所固有的挑战,包括可扩展性与对离群点的鲁棒性。尽管贝叶斯方法具有诸多优势(如不确定性感知预测、融入专家知识以及层次化建模),经典贝叶斯推断的质量关键取决于观测值是否符合所假设的数据生成模型,而这在实践中无法保证。本工作中,我们提出一种变分推断方法,以原则性方式同时扩展到大规模数据集,并使推断后验对观测数据中离群点的存在具有鲁棒性。通过 β-散度重构贝叶斯定理,我们提出以鲁棒化伪贝叶斯后验作为推断目标。此外,基于近期可扩展贝叶斯推断的黎曼核心集(Riemannian coresets)公式,我们提出该鲁棒化后验的稀疏变分近似以及一种高效的随机黑盒算法来构建它。总体而言,我们的方法可释放经清洗的数据摘要,广泛适用于包括结构化数据损坏在内的场景。我们在多种模拟与真实数据集以及各类统计模型(包括高斯均值推断、逻辑回归与神经线性回归)中展示了本方法的适用性,证明了其在离群点存在时相对于现有贝叶斯摘要方法的优越性。
引用
@article{arxiv.2008.13600,
title = {$\beta$-Cores: Robust Large-Scale Bayesian Data Summarization in the Presence of Outliers},
author = {Dionysis Manousakas and Cecilia Mascolo},
journal= {arXiv preprint arXiv:2008.13600},
year = {2020}
}
备注
25 pages, 5 figures, Accepted at the 14th ACM International Conference on Web Search and Data Mining