用于相似性搜索的哈希:综述
数据结构与算法
2014-08-14 v1 计算机视觉与模式识别
数据库
摘要
相似性搜索(最近邻搜索)是一个从大型数据库中追寻与查询项距离最小的数据项的问题。人们已经开发了各种方法来解决这个问题,近年来大量工作致力于近似搜索。在本文中,我们对主要解决方案之一——哈希进行了综述,自开创性工作局部敏感哈希 (locality sensitive hashing) 以来,哈希已被广泛研究。我们将哈希算法分为两大类:局部敏感哈希,其设计哈希函数时不探索数据分布;以及学习哈希,其根据数据分布学习哈希函数。我们从哈希函数设计、距离度量以及哈希编码空间中的搜索方案等多个方面对它们进行了回顾。
引用
@article{arxiv.1408.2927,
title = {Hashing for Similarity Search: A Survey},
author = {Jingdong Wang and Heng Tao Shen and Jingkuan Song and Jianqiu Ji},
journal= {arXiv preprint arXiv:1408.2927},
year = {2014}
}