中文

均匀采样对$k$-中位数的威力

数据结构与算法 2023-02-23 v1

摘要

我们研究了均匀采样在各种度量空间中对kk-Median的作用。我们将近似kk-Median的查询复杂度与数据集的一个关键参数——平衡度β(0,1]\beta \in (0, 1](其中11表示完全平衡)联系起来。我们证明,任何算法都必须对点集进行Ω(1/β)\Omega(1 / \beta)次查询,才能实现对kk-Median的O(1)O(1)-近似。这尤其意味着现有的coresets(一种流行的数据归约技术)构造无法在查询上高效。另一方面,我们证明,对于各种度量空间,均匀采样poly(kϵ1β1)\mathrm{poly}(k \epsilon^{-1} \beta^{-1})个点足以实现(1+ϵ)(1 + \epsilon)-近似的kk-Median,这几乎与下界匹配。我们进行了实验以验证在许多真实数据集中,平衡度参数通常有良好的界,并且即使对于平衡度中等较大的情况,均匀采样也始终表现良好,这证明了均匀采样确实是解决kk-Median的一种可行方法。

关键词

引用

@article{arxiv.2302.11339,
  title  = {The Power of Uniform Sampling for $k$-Median},
  author = {Lingxiao Huang and Shaofeng H. -C. Jiang and Jianing Lou},
  journal= {arXiv preprint arXiv:2302.11339},
  year   = {2023}
}