中文

$\mathcal{M}$-开设定下的贝叶斯模型选择——用于高效大规模留一法交叉验证的近似后验推断与概率比例规模子抽样

应用统计 2020-05-28 v1 统计计算

摘要

比较相互竞争的统计模型是心理学研究的重要组成部分。从贝叶斯视角,文献中已提出多种模型比较与选择的方法。然而,这些方法的适用性强烈依赖于关于模型空间 M\mathcal{M}(即所谓模型观)的假设。此外,传统方法如留一法交叉验证(LOO-CV)通过估计模型的期望对数预测密度(ELPD)来考察模型样本外泛化能力,当样本量变大时很快变得计算低效。在此,我们提供一个关于近似 Pareto 平滑重要性抽样留一法交叉验证(PSIS-LOO)的教程,这是一种计算高效的贝叶斯模型比较方法。首先,我们讨论几种模型观以及各自可用的贝叶斯模型比较方法。随后以贝叶斯逻辑回归为贯穿示例展示如何在实际中应用该方法,并表明其在计算代价上优于 LOO-CV 或信息准则等方法,同时提供精度相近的 ELPD 估计。第二步,我们展示如何通过后验近似结合概率比例规模子抽样,高效比较甚至大规模模型。我们展示如何基于所提供的 ELPD 估计比较竞争模型,并进行后验预测检验以防对某一考量中的模型过度自信。我们结论认为,该方法对旨在比较若干竞争统计模型(可能高维且处于大数据 regime)的数学心理学家颇具吸引力。

关键词

引用

@article{arxiv.2005.13199,
  title  = {Bayesian model selection in the $\mathcal{M}$-open setting -- Approximate posterior inference and probability-proportional-to-size subsampling for efficient large-scale leave-one-out cross-validation},
  author = {Riko Kelter},
  journal= {arXiv preprint arXiv:2005.13199},
  year   = {2020}
}