用于快速相似性搜索的自学习哈希
信息检索
2010-04-30 v1
摘要
在大规模下进行快速相似性搜索的能力对许多信息检索(IR)应用至关重要。加速相似性搜索的一种有前景的方法是语义哈希,它为大量文档设计紧凑的二进制码,使得语义相似的文档被映射到相似的码(在较短的汉明距离内)。尽管最近提出的一些技术能够为预先已知的文档生成高质量的码,但为先前未见过的文档获取码仍然是一个非常具有挑战性的问题。在本文中,我们强调这一问题并提出了一种新颖的自学习哈希(STH)方法用于语义哈希:我们首先通过无监督学习为给定语料库中的所有文档寻找最优的 位二进制码,然后通过有监督学习训练 个分类器,以预测任何先前未见查询文档的 位码。我们在三个真实文本数据集上的实验表明,所提出的采用二值化拉普拉斯特征映射和线性支持向量机(SVM)的方法显著优于现有技术。
引用
@article{arxiv.1004.5370,
title = {Self-Taught Hashing for Fast Similarity Search},
author = {Dell Zhang and Jun Wang and Deng Cai and Jinsong Lu},
journal= {arXiv preprint arXiv:1004.5370},
year = {2010}
}