公平近邻搜索:高维空间中的独立范围采样
数据结构与算法
2020-06-16 v2 计算几何
信息检索
机器学习
摘要
相似度搜索是一种基础的算法原语,广泛应用于许多计算机科学学科。相似度搜索问题有若干变体,其中最为相关的一种是 -近邻(-NN)问题:给定半径 和点集 ,构建一种数据结构,使得对于任意给定查询点 ,返回一个与 距离至多为 的点 。本文从公平性角度研究 -NN 问题。我们考虑机会均等的公平性:所有与查询点距离在 之内的点应具有相同的被返回概率。在低维情形中,该问题由 Hu、Qiao 和 Tao(PODS 2014)首次研究。局部敏感哈希(LSH)作为高维相似度搜索理论上最强的方法,并不提供这样的公平性保证。为此,我们提出了高效的 -NN 数据结构,其中 中所有靠近 的点具有相同概率被选中并由查询返回。具体而言,我们首先提出一种黑盒方法,给定任意 LSH 方案,可构建用于均匀采样查询邻域内点的数据结构。随后,我们开发了在内积下用于公平相似度搜索的数据结构,其需要近线性空间并利用局部敏感过滤器。本文以实验评估作结,在真实数据集的推荐场景中凸显了(不)公平性,并讨论了求解该问题其他变体所引入的固有不公平性。
引用
@article{arxiv.1906.01859,
title = {Fair Near Neighbor Search: Independent Range Sampling in High Dimensions},
author = {Martin Aumüller and Rasmus Pagh and Francesco Silvestri},
journal= {arXiv preprint arXiv:1906.01859},
year = {2020}
}
备注
Proceedings of the 39th ACM SIGMOD-SIGACT-SIGAI Symposium on Principles of Database Systems (PODS), Pages 191-204, June 2020