中文

偏斜数据的集合相似度搜索

数据结构与算法 2018-04-10 v1

摘要

集合相似度连接,以及相应的索引问题集合相似度搜索,是处理含噪或不确定数据的基本原语。例如,这些原语可用于数据清洗中以识别同一对象的不同表示。在许多情况下,可将对象表示为稀疏 0-1 向量,或等价地表示为该向量中非零项组成的集合。集合相似度连接随后可用于识别那些具有异常大点积(或视为集合时的交集)的对。我们选择聚焦于识别具有高 Pearson 相关的向量,但结果可推广至其他相似度度量。具体地,我们考虑从 {0,1}^d 中采样的向量集合 S 中识别相关向量的索引问题。给定查询向量 y 与参数 alpha ∈ (0,1),我们需在表示 S 中向量的数据结构中搜索一个 alpha-相关向量 x。此类相似度搜索在最坏情形(非随机数据)设定下已被深入研究。现有理论完备的集合相似度搜索方法常劣于利用数据分布偏斜(即 d 个维度上 1 的频率差异很大)的启发式方法。本文的主要贡献是在反映实践中所见此类偏斜数据分布的随机数据模型下分析集合相似度问题,从而获得比最坏情形设定下可能得到的强得多的理论结果。我们的索引数据结构受近期集合相似度搜索进展启发,是对向量的递归、数据依赖型划分。先前的数据依赖方法似乎无法让我们利用条目频率的偏斜,因此我们相信我们的工作进一步阐明了数据依赖的能力。

关键词

引用

@article{arxiv.1804.03054,
  title  = {Set Similarity Search for Skewed Data},
  author = {Samuel McCauley and Jesper W. Mikkelsen and Rasmus Pagh},
  journal= {arXiv preprint arXiv:1804.03054},
  year   = {2018}
}