面向最大内积搜索的范数分段 LSH
机器学习
2018-10-23 v2 机器学习
摘要
Neyshabur 和 Srebro 提出了 Simple-LSH,这是当前最先进且具有性能保证的用于最大内积搜索(MIPS)的哈希方法。我们发现 Simple-LSH 在理论与实践中均受限于真实数据集 2-范数分布的长尾。我们提出 Norm-ranging LSH,其通过将数据集划分为多个子数据集并为每个子数据集独立构建哈希索引,解决了 Simple-LSH 中由长尾引起的过度归一化问题。我们证明 Norm-ranging LSH 比 Simple-LSH 具有更低的查询时间复杂度。我们还表明划分数据集的思想可改进其他基于哈希的 MIPS 方法。为支持在子数据集哈希索引上的高效查询处理,提出了一种新颖的相似性度量。实验表明,在相同召回率下 Norm-ranging LSH 比 Simple-LSH 实现了一个数量级的加速,从而显著惠及涉及 MIPS 的应用。
引用
@article{arxiv.1809.08782,
title = {Norm-Ranging LSH for Maximum Inner Product Search},
author = {Xiao Yan and Jinfeng Li and Xinyan Dai and Hongzhi Chen and James Cheng},
journal= {arXiv preprint arXiv:1809.08782},
year = {2018}
}
备注
NIPS2018