MMD-FUSE:无需数据分割的学习与组合核的两样本检验方法
机器学习
2023-10-31 v2 机器学习
统计理论
统计方法学
统计理论
摘要
我们提出了新的统计量,通过在使用最大均值差异(Maximum Mean Discrepancy, MMD)定义的两样本检验中所用核的集合上进行自适应,来最大化其检验功效。对于有限集,这归结为通过加权软最大值组合这些核下各自的(归一化)MMD 值。我们证明了所提统计量在原假设和备择假设下的指数浓度界。我们进一步展示了如何以数据依赖但与置换无关的方式,在良好校准的检验中选择这些核,从而避免数据分割。该技术更广泛地适用于基于置换的通用 MMD 检验,并包含使用以自编码器等无监督模型学习的特征所构造的深度核。我们突出了我们的 MMD-FUSE 检验在合成低维数据和真实世界高维数据上的适用性,并将其在功效方面与当前最先进(state-of-the-art, SOTA)核检验的性能进行了比较。
引用
@article{arxiv.2306.08777,
title = {MMD-FUSE: Learning and Combining Kernels for Two-Sample Testing Without Data Splitting},
author = {Felix Biggs and Antonin Schrab and Arthur Gretton},
journal= {arXiv preprint arXiv:2306.08777},
year = {2023}
}
备注
38 pages,8 figures, 1 table