中文

破碎样本问题重访:Bai-Hsing 猜想的证明与高维推广

统计理论 2025-03-20 v1 信息论 math.IT 统计理论

摘要

我们重访经典的破碎样本问题:观察到两组独立同分布的数据点 X={X1,,Xn}\mathbf{X}=\{X_1,\cdots, X_n\}Y={Y1,,Ym}\mathbf{Y}=\{Y_1,\cdots,Y_m\},且两组数据之间无对应关系,且 mnm\leq n。在原假设下,X\mathbf{X}Y\mathbf{Y} 相互独立;在备择假设下,Y\mathbf{Y}X\mathbf{X} 的随机子样本相关,即 (Xπ(i),Yi)(X_{\pi(i)},Y_i)'s 来自某个双变量分布,用于潜在映射 π:[m][n]\pi:[m] \to [n]。该问题最初由 DeGroot、Feder 和 Goel (1971) 提出,用于建模人口普查数据中的匹配记录,近期因其在数据去识别、数据集成和目标跟踪中的应用而重新受到关注。尽管已经历数十年的广泛研究,但即使在样本量相等(m=nm=n)的情况下,确定精确检测阈值仍是开放问题。我们假设 mmnn 按比例增长,表明检测阈值的精确值由似然比算子的谱条件和 L2L_2 条件决定,正式解决了 Bai 和 Hsing (2005) 的猜想。这些结果推广到高维情形,解决了高斯和伯努利模型的精确检测阈值。

关键词

引用

@article{arxiv.2503.14619,
  title  = {The broken sample problem revisited: Proof of a conjecture by Bai-Hsing and high-dimensional extensions},
  author = {Simiao Jiao and Yihong Wu and Jiaming Xu},
  journal= {arXiv preprint arXiv:2503.14619},
  year   = {2025}
}

备注

35 pages, 3 figures