经验贝叶斯估计:g-建模在理论上(及实践中)何时优于 f-建模?
统计理论
2024-11-21 v2 统计方法学
统计理论
摘要
经验贝叶斯(EB)是一种流行的大规模推断框架,旨在寻找数据驱动的估计量以与已知真实先验的贝叶斯预言机竞争。多年来出现了两种有原则的 EB 估计方法:f-建模,通过估计数据的边际分布来构造近似贝叶斯规则;以及 g-建模,从数据估计先验然后应用学习到的贝叶斯规则。对于泊松模型,其典型例子分别是著名的 Robbins 估计量和非参数极大似然估计(NPMLE)。长期以来在实践中已认识到,Robbins 估计量虽然在概念上吸引人且计算简单,但缺乏稳健性,并容易被“离群值”带偏,而不像 NPMLE 因其贝叶斯形式提供更稳定且可解释的拟合。另一方面,现有理论不仅很少阐明这一现象,而且都指向相反结论,因为这两种方法近来均被证明在紧支撑和次指数先验下关于后悔值(超出贝叶斯风险的部分)是最优的。本文通过考虑具有有界 p>1 阶矩的先验,为 g-建模相对于 f-建模在重尾数据上的优越性提供了理论依据。我们证明,在温和正则化下,任何在密度估计中达到 Hellinger 速率最优的 g-建模方法都实现最优总后悔值 ;特别地,NPMLE 的特例无需正则化即成功。相比之下,存在一种 f-建模估计量其密度估计速率最优但 EB 后悔值以多项式因子次优。这些结果表明,恰当的贝叶斯形式提供了适用于所有 g-建模(而非 f-建模)方法的最优 EB 估计的“成功通用配方”。
引用
@article{arxiv.2211.12692,
title = {Empirical Bayes estimation: When does $g$-modeling beat $f$-modeling in theory (and in practice)?},
author = {Yandi Shen and Yihong Wu},
journal= {arXiv preprint arXiv:2211.12692},
year = {2024}
}
备注
New results including general positive results on g-modeling and negative results on f-modeling; optimality of unregularized NPMLE; extension to compound setting