中文

高维统计中的可重复性

机器学习 2024-06-06 v1 计算复杂性 数据结构与算法 机器学习

摘要

可重复性危机是近乎所有实证科学领域的主要问题,迫切需要在统计学中正式研究可重复性问题。受此背景动机,[Impagliazzo 等于 2022 年在 STOC 中引入了可重复学习算法的概念,并给出针对 1 维任务(包括统计查询)的基本程序。本文我们研究在几个基本高维统计任务中的可重复性,如多假设检验和均值估计。我们的主要贡献建立了最优可重复算法与高维等距瓷砖之间的计算和统计等价性。因此,我们获得了可重复均值估计的样本复杂度上界和下界,该问题由 [Bun 等于 2023 年在 STOC 中提出],以及 N 硬币问题的样本复杂度下界,这一问题由 [Karbasi 等于 2023 年在 NeurIPS 中提出],后者在对数因子上得到解决。虽然我们的等价性是计算性的,允许我们从已知最佳高效算法中削减 log 因子的样本复杂度,但高效等距瓷砖尚不为人所知。为克服这一困难,我们引入了几种放宽的范式,允许样本和计算上高效的算法,包括允许预处理、可适应性和近似可重复性。在这些情况下,我们给出的高效算法与均值估计和硬币问题的最佳已知样本复杂度相匹配或更好,包括一种通用程序将可重复性的常规二次开销降低为期望下的线性。

关键词

引用

@article{arxiv.2406.02628,
  title  = {Replicability in High Dimensional Statistics},
  author = {Max Hopkins and Russell Impagliazzo and Daniel Kane and Sihan Liu and Christopher Ye},
  journal= {arXiv preprint arXiv:2406.02628},
  year   = {2024}
}

备注

119 pages