中文

Lucene 在任意稠密向量上的近似最近邻搜索

信息检索 2019-10-29 v2

摘要

我们展示了三种将开源 Lucene 搜索库改造为在任意稠密向量上执行近似最近邻搜索的方法,并以词嵌入上的相似度搜索作为案例研究。Lucene 的核心围绕文档集合的(稀疏)词-文档矩阵的倒排索引构建,这与深度学习中常见的低维稠密向量不兼容。我们评估了三种可原生集成到 Lucene 中的克服这些挑战的技术:用伪词填充文档、对稠密向量的词法实现应用 LSH,以及结合降维的 k-d 树。实验表明,“伪词”方法在效果与效率之间取得了最佳平衡。这些技术已集成到 Anserini 开源工具包中并向社区提供。

关键词

引用

@article{arxiv.1910.10208,
  title  = {Lucene for Approximate Nearest-Neighbors Search on Arbitrary Dense Vectors},
  author = {Tommaso Teofili and Jimmy Lin},
  journal= {arXiv preprint arXiv:1910.10208},
  year   = {2019}
}