中文

相似连接的动态枚举

数据结构与算法 2021-05-06 v1 数据库

摘要

本文考虑在动态更新下枚举相似连接查询的回答:给定Rd\mathbb{R}^d中两组各nn个点A,BA,B、度量ϕ()\phi(\cdot)和距离阈值r>0r > 0,报告所有满足ϕ(a,b)r\phi(a,b) \le r的点对(a,b)A×B(a, b) \in A \times B。我们的目标是将A,BA,B存储于动态数据结构中,该结构在被查询时可枚举所有结果对且具备最坏情况延迟保证,即枚举连续两对之间的时间有界。此外,当点被插入或删除于AABB时,数据结构可高效更新。我们提出了若干高效数据结构以在低维下回答相似连接查询。对于相似连接的精确枚举,我们针对1,\ell_1, \ell_\infty度量给出了近线性大小的数据结构,其更新时间与延迟均为logO(1)n\log^{O(1)} n。我们证明对于d4d \ge 42\ell_2度量,此类数据结构不可行。对于相似连接的近似枚举(其中距离阈值为软约束),我们获得了针对p\ell_p度量的统一线性大小数据结构,具有logO(1)n\log^{O(1)} n的延迟与更新时间。在高维下,我们利用局部敏感哈希(LSH)给出了具备最坏情况延迟保证的高效数据结构。

关键词

引用

@article{arxiv.2105.01818,
  title  = {Dynamic Enumeration of Similarity Joins},
  author = {Pankaj K. Agarwal and Xiao Hu and Stavros Sintos and Jun Yang},
  journal= {arXiv preprint arXiv:2105.01818},
  year   = {2021}
}