中文

高维空间中的确定性聚类:草图与近似

数据结构与算法 2023-10-09 v1

摘要

在所有最先进的用于聚类的草图与coreset技术,以及已知最好的固定参数可处理近似算法中,随机性起着关键作用。对于经典的k-median和k-means问题,尚无已知的确定性降维过程或coreset构造能够避免对输入维度d、精度参数ε^-1或k的指数依赖。此外,也不存在以1-1/n概率成功且其大小不依赖于输入点数量n的coreset构造。这导致该领域的研究者询问随机性对聚类草图的能力何在[Feldman, WIREs Data Mining Knowl. Discov'20]。类似地,在不具有维度指数复杂度的前提下,确定性可达成的最佳近似比对k-median和k-means均为Ω(1),即使允许在簇数k上复杂度为FPT。这与在允许随机化时该情况下可实现的(1+ε)-近似形成鲜明对比。在本文中,我们提供了聚类的确定性草图构造,其大小界限接近已知最好的随机化版本。我们还构造了一种确定性算法,用于在时间2^{k^2/ε^{O(1)}} poly(nd)内计算高维欧几里得空间中k-median和k-means的(1+ε)-近似,接近最佳随机化复杂度。此外,我们在草图上的新见解还产生了一种使用均匀采样的随机化coreset构造,其立即通过因子k改进了[Braverman et al. FOCS '22]近期的结果。

关键词

引用

@article{arxiv.2310.04076,
  title  = {Deterministic Clustering in High Dimensional Spaces: Sketches and Approximation},
  author = {Vincent Cohen-Addad and David Saulpic and Chris Schwiegelshohn},
  journal= {arXiv preprint arXiv:2310.04076},
  year   = {2023}
}

备注

FOCS 2023. Abstract reduced for arxiv requirements