中文

经验贝叶斯估计:g-建模在理论上(及实践中)何时优于 f-建模?

统计理论 2024-11-21 v2 统计方法学 统计理论

摘要

经验贝叶斯(EB)是一种流行的大规模推断框架,旨在寻找数据驱动的估计量以与已知真实先验的贝叶斯预言机竞争。多年来出现了两种有原则的 EB 估计方法:f-建模,通过估计数据的边际分布来构造近似贝叶斯规则;以及 g-建模,从数据估计先验然后应用学习到的贝叶斯规则。对于泊松模型,其典型例子分别是著名的 Robbins 估计量和非参数极大似然估计(NPMLE)。长期以来在实践中已认识到,Robbins 估计量虽然在概念上吸引人且计算简单,但缺乏稳健性,并容易被“离群值”带偏,而不像 NPMLE 因其贝叶斯形式提供更稳定且可解释的拟合。另一方面,现有理论不仅很少阐明这一现象,而且都指向相反结论,因为这两种方法近来均被证明在紧支撑和次指数先验下关于后悔值(超出贝叶斯风险的部分)是最优的。本文通过考虑具有有界 p>1 阶矩的先验,为 g-建模相对于 f-建模在重尾数据上的优越性提供了理论依据。我们证明,在温和正则化下,任何在密度估计中达到 Hellinger 速率最优的 g-建模方法都实现最优总后悔值 Θ~(n32p+1)\tilde \Theta(n^{\frac{3}{2p+1}});特别地,NPMLE 的特例无需正则化即成功。相比之下,存在一种 f-建模估计量其密度估计速率最优但 EB 后悔值以多项式因子次优。这些结果表明,恰当的贝叶斯形式提供了适用于所有 g-建模(而非 f-建模)方法的最优 EB 估计的“成功通用配方”。

关键词

引用

@article{arxiv.2211.12692,
  title  = {Empirical Bayes estimation: When does $g$-modeling beat $f$-modeling in theory (and in practice)?},
  author = {Yandi Shen and Yihong Wu},
  journal= {arXiv preprint arXiv:2211.12692},
  year   = {2024}
}

备注

New results including general positive results on g-modeling and negative results on f-modeling; optimality of unregularized NPMLE; extension to compound setting