近似最近邻搜索哈希算法的再探讨
计算机视觉与模式识别
2019-06-20 v6
摘要
近似最近邻搜索(ANNS)是机器学习和数据挖掘许多领域的基础问题。在过去十年中,提出了大量哈希算法来解决该问题。每个提出的算法都声称优于其他 state-of-the-art 哈希方法。然而,这些哈希论文的评估不够充分,这些声明需要重新审视。ANNS 方法的最终目标是在最短时间内返回最准确的答案(最近邻)。如果实现正确,几乎所有哈希方法的性能都会随着码长的增加而提高。然而,许多现有的哈希论文仅报告码长短于128时的性能。在本文中,我们仔细重新审视了哈希索引搜索问题,并分析了两流行哈希索引搜索过程的优缺点。然后我们提出了一种非常简单但有效的两层索引结构,并对十一种流行的哈希算法进行了全面比较。令人惊讶的是,基于随机投影的局部敏感哈希(LSH)是表现最好的算法,这与所有其他十篇哈希论文中的声明相矛盾。尽管基于随机投影的 LSH 极其简单,我们的结果表明该算法的能力被远远低估了。为了可复现性,本文使用的所有代码均在 GitHub 上发布,可用作各种哈希算法之间公平比较的测试平台。
引用
@article{arxiv.1612.07545,
title = {A Revisit of Hashing Algorithms for Approximate Nearest Neighbor Search},
author = {Deng Cai},
journal= {arXiv preprint arXiv:1612.07545},
year = {2019}
}