可扩展且鲁棒的集合相似度连接
数据库
2018-03-05 v3 数据结构与算法
摘要
集合相似度连接是一种基础且被广泛研究的数据库算子。它通常在精确设定下进行研究,其目标是计算所有超过给定相似度阈值(例如以 Jaccard 相似度衡量)的集合对。但集合相似度连接常被用于 100% 召回率可能并不重要的场景中——事实上,在这些场景中,精确集合相似度连接本身也只是对期望结果集的一种近似。我们提出了一种新的用于集合相似度连接的随机算法,该算法能够实现高达 100% 的任意期望召回率,并从理论和经验上证明其显著优于现有方法。目前最先进的精确方法基于前缀过滤,其性能取决于数据集是否包含大量稀有词元。我们的方法对数据中缺乏此类结构具有鲁棒性。在 90% 召回率下,根据数据集对前缀过滤的适用程度,我们的算法通常比最先进的精确方法快一个数量级以上。我们在基准数据集上的实验还表明,该方法比可比的近似方法快数倍。我们的算法利用了高维草图与索引方面的最新理论进展,我们相信这些进展对数据工程界具有更广泛的意义。
引用
@article{arxiv.1707.06814,
title = {Scalable and robust set similarity join},
author = {Tobias Christiani and Rasmus Pagh and Johan Sivertsen},
journal= {arXiv preprint arXiv:1707.06814},
year = {2018}
}