中文

具有强与弱距离预言机的度量聚类与最小生成树

数据结构与算法 2023-10-25 v1

摘要

我们研究度量空间 (X,d)(\mathcal{X},d) 中的优化问题,其中我们可以通过两种方式计算距离:通过返回精确距离 d(x,y)d(x,y) 的“强”预言机,以及通过返回距离 d~(x,y)\tilde{d}(x,y) 的“弱”预言机,该距离可能以一定概率被任意破坏。该模型刻画了日益常见的权衡:同时使用昂贵的相似性模型(例如大规模嵌入模型)与较不准确但更廉价的模型。因此,目标是尽可能少地查询强预言机。我们考虑所谓的“点查询”(在点的集合 SXS \subset \mathcal{X} 上查询强预言机,并返回所有 x,ySx,y \in Sd(x,y)d(x,y))以及“边查询”(对单个距离 d(x,y)d(x,y) 进行查询)。我们的主要贡献是在该模型下针对聚类和最小生成树(MST)给出了最优算法与下界。对于 kk-centers、kk-median 和 kk-means,我们给出了仅需 O~(k)\tilde{O}(k) 次强预言机点查询的常数因子近似算法,并证明任何有界近似都需要 Ω(k)\Omega(k) 次查询。对于边查询,我们的上界与下界均为 Θ~(k2)\tilde{\Theta}(k^2)。令人惊讶的是,对于 MST 问题,我们给出了一个完全不使用强预言机查询的 O(logn)O(\sqrt{\log n}) 近似算法,以及与之匹配的 Ω(logn)\Omega(\sqrt{\log n}) 下界。我们对算法进行了实证评估,表明其质量与获得所有真实距离的基线算法相当,但仅在极小部分(小于 1%1\%)的点上查询了强预言机。

关键词

引用

@article{arxiv.2310.15863,
  title  = {Metric Clustering and MST with Strong and Weak Distance Oracles},
  author = {MohammadHossein Bateni and Prathamesh Dharangutte and Rajesh Jayaram and Chen Wang},
  journal= {arXiv preprint arXiv:2310.15863},
  year   = {2023}
}