自适应局部敏感哈希的序贯假设检验方法
信息检索
2016-06-29 v1
摘要
全对相似性搜索问题是指给定一组数据对象,在特定相似性度量下,找出所有相似度高于某一阈值的对象对。当数据点数量或维度很高时,标准解决方案无法优雅地扩展。近似解决方案,如局部敏感哈希(LSH)及其贝叶斯变体(BayesLSH 和 BayesLSHLite),在一定程度上缓解了该问题,并相比传统的基于索引的方法提供了显著的加速。BayesLSH用于剪枝候选空间和计算近似相似度,而BayesLSHLite只能剪枝候选对象,相似度需要在原始数据上精确计算。因此,在显式数据表示可用且精确相似度计算成本不太高的情况下,可以使用BayesLSHLite来激进地剪枝候选对象,并在不过多损失质量的情况下提供显著的加速。然而,在BayesLSH变体中,质量损失更高,因为此时显式数据表示不可用,只有哈希签名可用,相似度必须近似估计。在这项工作中,我们从频率学派的视角重新审视LSH问题,并为复合假设(相似度大于或小于阈值)制定了搜索序贯检验,此类LSH算法可以利用这些检验来自适应地激进剪枝候选对象。我们基于此思想提出了一种基础的序贯概率比检验(SPRT)方法及其两种新颖的变体。我们将这些变体扩展到需要使用固定宽度序贯置信区间生成技术来计算近似相似度的情况。
引用
@article{arxiv.1412.3103,
title = {Sequential Hypothesis Tests for Adaptive Locality Sensitive Hashing},
author = {Aniket Chakrabarti and Srinivasan Parthasarathy},
journal= {arXiv preprint arXiv:1412.3103},
year = {2016}
}