中文

分布检验中容忍度的代价

数据结构与算法 2021-11-10 v2 信息论 math.IT 概率论 统计理论 机器学习 统计理论

摘要

我们重新审视容忍分布检验问题。即给定来自未知分布 pp(定义于 {1,,n}\{1, \dots, n\})的样本,判断其在总变差距离下与参考分布 qqε1\varepsilon_1-接近还是 ε2\varepsilon_2-远离?尽管过去十年间受到极大关注,该问题仅在极端情形下被充分理解。在无噪设定(即 ε1=0\varepsilon_1 = 0)下样本复杂度为 Θ(n)\Theta(\sqrt{n}),强亚线性于定义域大小。在另一极端,当 ε1=ε2/2\varepsilon_1 = \varepsilon_2/2 时,样本复杂度跃升至仅微弱亚线性的 Θ(n/logn)\Theta(n/\log n)。然而,关于中间区域所知甚少。我们将分布检验中容忍度的代价作为 nnε1\varepsilon_1ε2\varepsilon_2 的函数完全刻画,仅差一个 logn\log n 因子。具体而言,我们给出样本复杂度为 Θ~(nε22+nlognmax{ε1ε22,(ε1ε22) ⁣ ⁣2}),\tilde \Theta\left(\frac{\sqrt{n}}{\varepsilon_2^{2}} + \frac{n}{\log n} \cdot \max \left\{\frac{\varepsilon_1}{\varepsilon_2^2},\left(\frac{\varepsilon_1}{\varepsilon_2^2}\right)^{\!\!2}\right\}\right), 从而在两种已知情形间提供了平滑的权衡。我们也对容忍等价检验问题给出了类似刻画,其中 ppqq 均未知。令人惊讶的是,在这两种情况下,决定样本复杂度的主要量是比值 ε1/ε22\varepsilon_1/\varepsilon_2^2,而非更直观的 ε1/ε2\varepsilon_1/\varepsilon_2。尤其具有技术意义的是我们的下界框架,其涉及处理 ε1\varepsilon_1ε2\varepsilon_2 间不对称性所需的新颖逼近论工具,这是以往工作所未有的挑战。

关键词

引用

@article{arxiv.2106.13414,
  title  = {The Price of Tolerance in Distribution Testing},
  author = {Clément L. Canonne and Ayush Jain and Gautam Kamath and Jerry Li},
  journal= {arXiv preprint arXiv:2106.13414},
  year   = {2021}
}

备注

Added a result on instance-optimal testing, and further discussion in the introduction