内积相似连接的复杂性
数据结构与算法
2016-04-08 v3 数据库
机器学习
摘要
分类、信息检索、推荐系统和记录链接中的许多任务可归约为内积相似连接(IPS join)这一核心问题:在集合中找出具有足够大内积的向量对。当向量被归一化且允许内积的某种近似时,IPS join已被充分理解。然而,向量可能具有任意长度的一般情况显得更具挑战性。近来,基于非对称局部敏感哈希(ALSH)和非对称嵌入的新上限已经出现,但在下界方面知之甚少。本文中,我们发起对内积相似连接的系统性研究,给出了新的下界和上界。我们的主要结果是:* 假设强指数时间假设,IPS join在子二次时间内的近似硬度。* 针对基于(A)LSH算法的新上界和下界。特别地,我们表明通过放宽LSH定义以仅考虑不同元素的碰撞概率,可以避免非对称性。* 一种基于线性草图的IPS新索引方法,意味着我们的硬度结果离紧致不远。我们的技术贡献包括可能具有独立价值的新非对称嵌入。在概念层面,我们力求提供更大的清晰性,例如通过区分IPS join的符号和无符号变体,并阐明非对称性的影响。
引用
@article{arxiv.1510.02824,
title = {On the Complexity of Inner Product Similarity Join},
author = {Thomas D. Ahle and Rasmus Pagh and Ilya Razenshteyn and Francesco Silvestri},
journal= {arXiv preprint arXiv:1510.02824},
year = {2016}
}
备注
in Proc. 35th ACM Symposium on Principles of Database Systems, 2016