面向学习型稀疏表示近似检索的高效倒排索引
信息检索
2024-07-15 v1
摘要
学习型稀疏表示构成了一类用于文本检索的、有吸引力的上下文嵌入。这是因为它们是有效的相关性模型,并且设计上具有可解释性。尽管它们表面上与倒排索引兼容,然而,在稀疏嵌入上进行检索仍然具有挑战性。这是由于学习型嵌入与基于词频的相关性词汇模型(如 BM25)之间存在分布差异。认识到这一挑战,大量研究致力于设计适合学习型稀疏表示特性的检索算法,包括近似检索系统。事实上,这项任务在最近的 NeurIPS 2023 BigANN 挑战赛中占据了突出地位,该比赛在一个大型基准数据集上通过吞吐量和召回率评估了近似算法。在这项工作中,我们提出了一种新颖的倒排索引组织方式,能够实现对学习型稀疏嵌入的快速且有效的近似检索。我们的方法将倒排列表组织成几何内聚的块,每个块都配备一个摘要向量。在查询处理过程中,我们利用摘要快速确定是否必须评估某个块。正如我们通过实验所展示的,使用我们的方法 Seismic 进行单线程查询处理,在 MS MARCO 数据集的各种稀疏嵌入上达到了亚毫秒级的每查询延迟,同时保持了高召回率。我们的结果表明,Seismic 比最先进的基于倒排索引的解决方案快一到两个数量级,并且以显著优势超越了 BigANN 挑战赛的获胜(基于图的)提交方案。
引用
@article{arxiv.2404.18812,
title = {Efficient Inverted Indexes for Approximate Retrieval over Learned Sparse Representations},
author = {Sebastian Bruch and Franco Maria Nardini and Cosimo Rulli and Rossano Venturini},
journal= {arXiv preprint arXiv:2404.18812},
year = {2024}
}