中文

高维大规模多媒体数据集中用于相似性搜索的可扩展局部敏感哈希

分布式、并行与集群计算 2013-10-16 v1 数据库 信息检索

摘要

相似性搜索对于许多数据库应用至关重要,包括日益流行的基于内容的多媒体检索 (CBMR) 在线服务。这些服务(包括图像搜索引擎)必须处理海量的数据,同时保持低响应时间。因此,可扩展性对于 Web 规模应用中的相似性搜索势在必行,但大多数现有方法是顺序的且针对共享内存机器。在此,我们利用基于局部敏感哈希 (LSH) 的分布式、高效且可扩展的索引来解决这些问题。LSH 是最有效且流行的相似性搜索技术之一,但其较差的引用局部性特性使其实现成为一个具有挑战性的问题。我们的解决方案基于广泛异步的数据流并行化,并进行了一系列优化,包括用于解耦索引和数据存储的分层并行化、用于减少消息传递的感知局部性的数据划分策略,以及用于限制内存使用的多重探测。所提出的并行化方案在拥有约 800 个 CPU 核心的分布式系统中达到了 90% 的效率。特别是,原始的感知局部性的数据划分将交换的消息数量减少了 30%。我们的并行 LSH 使用了迄今为止(据我们所知)最大的公开相似性搜索数据集进行评估,该数据集包含从 Web 图像中提取的10910^9个 128 维 SIFT 描述符。这比先前 LSH 并行化方案所能处理的数据集大了两个数量级。

关键词

引用

@article{arxiv.1310.4136,
  title  = {Scalable Locality-Sensitive Hashing for Similarity Search in High-Dimensional, Large-Scale Multimedia Datasets},
  author = {Thiago S. F. X. Teixeira and George Teodoro and Eduardo Valle and Joel H. Saltz},
  journal= {arXiv preprint arXiv:1310.4136},
  year   = {2013}
}