中文

存在任意主导噪声下的分布测试及验证查询

数据结构与算法 2025-09-23 v1 离散数学

摘要

我们研究在无法直接获取相关数据源,仅能访问极小比例为相关数据的情形下的分布测试问题。为实现此目标,我们引入了以下验证查询模型。目标是对分布 p\boldsymbol{p} 进行统计任务,给定对混合分布 r=λp+(1λ)q\boldsymbol{r} = \lambda \boldsymbol{p} + (1-\lambda)\boldsymbol{q} 的样本访问权限,以及查询样本是由 p\boldsymbol{p} 还是 q\boldsymbol{q} 生成的能力。在一般情况下,如果 m0m_0 个来自 p\boldsymbol{p} 的样本足以完成某个任务,那么在本模型下,O(m0/λ)O(m_0/\lambda) 个样本和查询总是足够的。是否存在某些任务可以显著降低查询数量?我们研究了分布测试中的经典问题,获得了匹配的上界和下界,揭示了样本复杂度与查询复杂度之间的平滑权衡。对于所有 mnm \leq n,我们获得:(i) 使用 O(m+nε2λ)O(m + \frac{\sqrt{n}}{\varepsilon^2 \lambda}) 个样本和 O(nmε4λ2)O(\frac{n}{m \varepsilon^4 \lambda^2}) 个查询的均匀性和身份测试器,以及 (ii) 使用 O(m+n2/3ε4/3λ+1ε4λ3)O(m + \frac{n^{2/3}}{\varepsilon^{4/3} \lambda} + \frac{1}{\varepsilon^4 \lambda^3}) 个样本和 O(n2m2ε4λ3)O(\frac{n^2}{m^2 \varepsilon^4 \lambda^3}) 个查询的相似性测试器。此外,我们证明了对于所有使用 mnm \ll n 个样本的测试器,这些查询复杂度都是紧的。接下来,我们表明使用 m=O~(nε2λ)m = \widetilde{O}(\frac{n}{\varepsilon^2\lambda}) 个样本进行相似性测试时,可以实现查询复杂度 O~(1ε2λ)\widetilde{O}(\frac{1}{\varepsilon^2\lambda}),这即使是使用无限样本进行基本偏差估计任务也几乎是最优的。我们的均匀性测试器在受到自适应对手生成的污染样本的更具挑战性的环境中工作(需付出 logn\log n 因子的代价)。最后,我们表明如果算法获得了混合物的 PDF,则可以规避这些下界。

关键词

引用

@article{arxiv.2509.17269,
  title  = {Distribution Testing in the Presence of Arbitrarily Dominant Noise with Verification Queries},
  author = {Hadley Black and Christopher Ye},
  journal= {arXiv preprint arXiv:2509.17269},
  year   = {2025}
}