中文

公平近邻搜索:高维空间中的独立范围采样

数据结构与算法 2020-06-16 v2 计算几何 信息检索 机器学习

摘要

相似度搜索是一种基础的算法原语,广泛应用于许多计算机科学学科。相似度搜索问题有若干变体,其中最为相关的一种是 rr-近邻(rr-NN)问题:给定半径 r>0r>0 和点集 SS,构建一种数据结构,使得对于任意给定查询点 qq,返回一个与 qq 距离至多为 rr 的点 pp。本文从公平性角度研究 rr-NN 问题。我们考虑机会均等的公平性:所有与查询点距离在 rr 之内的点应具有相同的被返回概率。在低维情形中,该问题由 Hu、Qiao 和 Tao(PODS 2014)首次研究。局部敏感哈希(LSH)作为高维相似度搜索理论上最强的方法,并不提供这样的公平性保证。为此,我们提出了高效的 rr-NN 数据结构,其中 SS 中所有靠近 qq 的点具有相同概率被选中并由查询返回。具体而言,我们首先提出一种黑盒方法,给定任意 LSH 方案,可构建用于均匀采样查询邻域内点的数据结构。随后,我们开发了在内积下用于公平相似度搜索的数据结构,其需要近线性空间并利用局部敏感过滤器。本文以实验评估作结,在真实数据集的推荐场景中凸显了(不)公平性,并讨论了求解该问题其他变体所引入的固有不公平性。

关键词

引用

@article{arxiv.1906.01859,
  title  = {Fair Near Neighbor Search: Independent Range Sampling in High Dimensions},
  author = {Martin Aumüller and Rasmus Pagh and Francesco Silvestri},
  journal= {arXiv preprint arXiv:1906.01859},
  year   = {2020}
}

备注

Proceedings of the 39th ACM SIGMOD-SIGACT-SIGAI Symposium on Principles of Database Systems (PODS), Pages 191-204, June 2020