中文

使用 Lucene 的端到端稠密与稀疏表示学习检索

信息检索 2023-12-01 v1

摘要

双编码器架构为理解基于稠密与稀疏向量表示的机器学习检索模型提供了框架。尽管这些表示捕捉了同一底层概念框架的参数化实现,它们各自的 top-kk 相似度搜索实现需要协调不同的软件组件(例如倒排索引、HNSW 索引和神经网络推理工具包),通常以复杂架构拼接在一起。在这项工作中,我们提出以下问题:就最少改动现有基础设施而言,支持现代稠密与稀疏表示端到端检索的最简设计是什么?答案似乎是 Lucene 已足够,正如我们在可复现信息检索研究工具包 Anserini 中所展示的。也就是说,使用现代单向量神经模型的有效检索可以直接在 CPU 上的 Java 中高效执行。我们考察了这一设计对推进前沿的信息检索研究者以及构建生产搜索系统的软件工程师的意义。

关键词

引用

@article{arxiv.2311.18503,
  title  = {End-to-End Retrieval with Learned Dense and Sparse Representations Using Lucene},
  author = {Haonan Chen and Carlos Lassance and Jimmy Lin},
  journal= {arXiv preprint arXiv:2311.18503},
  year   = {2023}
}