中文

近似最近邻搜索哈希算法的再探讨

计算机视觉与模式识别 2019-06-20 v6

摘要

近似最近邻搜索(ANNS)是机器学习和数据挖掘许多领域的基础问题。在过去十年中,提出了大量哈希算法来解决该问题。每个提出的算法都声称优于其他 state-of-the-art 哈希方法。然而,这些哈希论文的评估不够充分,这些声明需要重新审视。ANNS 方法的最终目标是在最短时间内返回最准确的答案(最近邻)。如果实现正确,几乎所有哈希方法的性能都会随着码长的增加而提高。然而,许多现有的哈希论文仅报告码长短于128时的性能。在本文中,我们仔细重新审视了哈希索引搜索问题,并分析了两流行哈希索引搜索过程的优缺点。然后我们提出了一种非常简单但有效的两层索引结构,并对十一种流行的哈希算法进行了全面比较。令人惊讶的是,基于随机投影的局部敏感哈希(LSH)是表现最好的算法,这与所有其他十篇哈希论文中的声明相矛盾。尽管基于随机投影的 LSH 极其简单,我们的结果表明该算法的能力被远远低估了。为了可复现性,本文使用的所有代码均在 GitHub 上发布,可用作各种哈希算法之间公平比较的测试平台。

关键词

引用

@article{arxiv.1612.07545,
  title  = {A Revisit of Hashing Algorithms for Approximate Nearest Neighbor Search},
  author = {Deng Cai},
  journal= {arXiv preprint arXiv:1612.07545},
  year   = {2019}
}