中文

提升核双样本检验的功效

统计方法学 2024-09-06 v2 统计理论 机器学习 统计理论

摘要

基于最大均值差异(MMD)的核双样本检验是检测一般度量空间上两个分布之间差异最流行的方法之一。在本文中,我们提出一种方法,通过利用多个核的 MMD 估计的马哈拉诺比斯距离将它们组合,从而提升核检验的功效。我们推导了所提检验统计量的渐近零分布,并使用乘子自助法(multiplier bootstrap)高效地计算拒绝域。所得检验是一致一致的,并且由于它是通过对一组核/带宽进行聚合得到的,在有限样本中能更有力地检测广泛的备择假设。我们还推导了检验统计量在固定备择和局部 contiguous 备择下的分布。后者尤其意味着所提检验在统计上是有效的,即具有非平凡的渐近(Pitman)效率。当核的数量允许随样本量增长时,我们也探讨了马哈拉诺比斯及其他自然聚合方法的一致性性质。我们在合成和真实世界数据集上进行了大量数值实验,以说明所提方法相对于单核检验的有效性。我们还从理论和模拟两方面研究了所提方法的计算复杂度。我们的渐近结果依赖于利用多重随机积分框架推导 MMD 估计的联合分布,该框架具有更广泛的用途,具体而言,可用于理解近期提出的基于核聚合的自适应 MMD 检验的效率性质,以及开发组合多个核的更具计算效率(线性时间)的检验。最后,我们将马哈拉诺比斯聚合方法应用于具有发散缩放参数的核。

关键词

引用

@article{arxiv.2302.10687,
  title  = {Boosting the Power of Kernel Two-Sample Tests},
  author = {Anirban Chatterjee and Bhaswar B. Bhattacharya},
  journal= {arXiv preprint arXiv:2302.10687},
  year   = {2024}
}

备注

Updated with additional results and simulations. To appear in Biometrika