中文

分类数据集相似性量化方法的经验比较

统计方法学 2026-04-14 v1 统计计算

摘要

对两个或多个数据集的相似性进行量化在统计和机器学习中有广泛应用。然而,由于提出的方法繁多且缺乏中性比较研究,特别是针对分类数据,方法选择往往困难重重。本文对最具前景的方法进行比较,评估其检测数据集之间特定差异的能力及其资源消耗。结果表明,边缘计数检验在比较两个数据集(即两样本情况)时表现良好。对于某些情景,受约束最小距离(CM)甚至更好。对于每个变量都有五个类别的分类数据,最佳方法取决于分布之间的差异类型,CM距离和某些基于图的检验或分类器基于检验(C2ST)可能表现最佳。这种倾向在多样本情况下更为明显。总体而言,Friedman-Rafsky检验可作为两个样本的折中方案,表现良好、资源消耗可接受且计算误差发生率较低。对于多样本情况,推荐使用多样本马哈拉诺斯交叉匹配(MMCM)检验,由于其相当好的性能和较低的资源消耗。

关键词

引用

@article{arxiv.2604.11458,
  title  = {An Empirical Comparison of Methods for Quantifying the Similarity of Categorical Datasets},
  author = {Marieke Stolte and Jörg Rahnenführer and Andrea Bommert},
  journal= {arXiv preprint arXiv:2604.11458},
  year   = {2026}
}