具有强与弱距离预言机的度量聚类与最小生成树
数据结构与算法
2023-10-25 v1
摘要
我们研究度量空间 中的优化问题,其中我们可以通过两种方式计算距离:通过返回精确距离 的“强”预言机,以及通过返回距离 的“弱”预言机,该距离可能以一定概率被任意破坏。该模型刻画了日益常见的权衡:同时使用昂贵的相似性模型(例如大规模嵌入模型)与较不准确但更廉价的模型。因此,目标是尽可能少地查询强预言机。我们考虑所谓的“点查询”(在点的集合 上查询强预言机,并返回所有 的 )以及“边查询”(对单个距离 进行查询)。我们的主要贡献是在该模型下针对聚类和最小生成树(MST)给出了最优算法与下界。对于 -centers、-median 和 -means,我们给出了仅需 次强预言机点查询的常数因子近似算法,并证明任何有界近似都需要 次查询。对于边查询,我们的上界与下界均为 。令人惊讶的是,对于 MST 问题,我们给出了一个完全不使用强预言机查询的 近似算法,以及与之匹配的 下界。我们对算法进行了实证评估,表明其质量与获得所有真实距离的基线算法相当,但仅在极小部分(小于 )的点上查询了强预言机。
引用
@article{arxiv.2310.15863,
title = {Metric Clustering and MST with Strong and Weak Distance Oracles},
author = {MohammadHossein Bateni and Prathamesh Dharangutte and Rajesh Jayaram and Chen Wang},
journal= {arXiv preprint arXiv:2310.15863},
year = {2023}
}