中文

贝叶斯核心子集质量的一般性界限

机器学习 2024-10-18 v2 机器学习 统计理论 统计计算 统计理论

摘要

贝叶斯核心子集通过以小型加权数据子集构建的替代对数似然函数来加速大规模数据 regime 下的数据后推断。然而,尽管贝叶斯核心子集及其构建方法适用于广泛的模型,但现有理论分析仅适用于限制性设置——即指数族模型或具有强对数凹性和光滑性假设的模型。本文提出贝叶斯核心子集Kullback-Leibler(KL)发散的一般性上、下界,涵盖贝叶斯核心子集的全范围适用性。下界仅需典型贝叶斯渐近分析的温和模型假设,上界要求对数似然函数满足弱于早期工作条件的广义亚指数性准则。下界用于获得核心子集近似的根本限制,阐明基于重要抽样构建方法在实际中的性能差的理论解释;上界用于分析近期抽样-优化方法的性能。该理论灵活性通过包含多模态、不可识别、厚尾贝叶斯后验分布的验证实验得以体现。

关键词

引用

@article{arxiv.2405.11780,
  title  = {General bounds on the quality of Bayesian coresets},
  author = {Trevor Campbell},
  journal= {arXiv preprint arXiv:2405.11780},
  year   = {2024}
}

备注

23 pages, 3 figures. Appearing in NeurIPS 2024