动态数据流中的高效相似性搜索
数据结构与算法
2021-03-09 v3
摘要
Jaccard 指数是项集和布尔数据的一种重要相似性度量。在大数据集上,由于时间和空间限制,对所有项对进行精确相似性计算通常不可行,因此催生了更快的近似方法。用于快速计算两个项集 和 的 Jaccard 指数 的首选算法通常是某种形式的 min-hashing。大多数 min-hashing 方案可在仅处理添加的数据流中维护,但目前尚无已知方案能处理逐项删除。本文研究了有理集合相似度(包括 Jaccard 在内的一大类相似性度量)的可扩展近似算法。受 Chierichetti 和 Kumar [J. ACM 2015] 结果的启发——他们证明任何有理集合相似度 当且仅当对应距离 是度量时,才存在局部敏感哈希 (LSH) 方案——我们可以证明,存在一种空间高效的数据摘要,能在动态数据流中维护对 的 乘性近似。这反过来也给出了相似度的 加性近似。这些近似的存在性暗示了动态数据流中 LSH 方案的可能性,但并未直接蕴含其存在。我们的第二个也是主要贡献在于设计了这样一种可在动态数据流中维护的 LSH 方案。该方案空间高效、易于实现,且据我们所知是首个能够处理删除操作的同类方案。
引用
@article{arxiv.1605.03949,
title = {Efficient Similarity Search in Dynamic Data Streams},
author = {Marc Bury and Chris Schwiegelshohn and Mara Sorella},
journal= {arXiv preprint arXiv:1605.03949},
year = {2021}
}