中文

分心时代中的邻近性:鲁棒近似最近邻搜索

计算几何 2015-11-24 v1

摘要

我们引入最近邻搜索问题的一个新变体,该变体允许数据集的某些坐标被任意破坏或未知。形式上,给定高维空间中包含 nn 个点 P={x1,,xn}P=\{ x_1,\ldots, x_n\} 的数据集,以及参数 kk,目标是预处理该数据集,使得给定查询点 qq 时,能够快速计算点 xPx \in P,使得在忽略“最优”的 kk 个坐标时,查询点到该点 xx 的距离最小。注意,被忽略的坐标是查询点和返回点的函数。我们给出了从该问题到回答 ANN(近似最近邻)查询的一个通用归约,其思想类似于 LSH(局部敏感哈希)[IM98]。具体而言,我们给出了一种采样技术,实现了该问题的双准则近似。如果在忽略 kk 个坐标后到最近邻的距离为 rr,该数据结构返回一个在忽略 O(k)O(k) 个坐标后距离在 O(r)O(r) 之内的点。我们还给出了上述结果的其他应用以及进一步的扩展和改进。新数据结构简单且(可以说)优雅,并且应当是实用的——具体而言,所有界限在所有相关参数(包括空间维度和鲁棒性参数 kk)上均为多项式的。

关键词

引用

@article{arxiv.1511.07357,
  title  = {Proximity in the Age of Distraction: Robust Approximate Nearest Neighbor Search},
  author = {Sariel Har-Peled and Sepideh Mahabadi},
  journal= {arXiv preprint arXiv:1511.07357},
  year   = {2015}
}