中文

将聚类倒排索引与kNN图配对以实现学习型稀疏表示上的快速近似检索

信息检索 2024-10-22 v1

摘要

学习型稀疏表示构成了一类有效且可解释的文本检索嵌入。虽然在此类嵌入上进行精确top-k检索面临效率挑战,但一种名为Seismic的最新算法已实现了显著快速、高精度的近似检索。Seismic静态地剪枝倒排列表,将每个列表组织成几何上内聚的块,并为每个块增加一个摘要向量。在查询时,与查询词项关联的每个倒排列表以任意顺序逐块遍历,通过查询与摘要之间的内积决定是否必须评估某个块。当一个块被认为有希望时,其文档将通过正排索引进行完全评估。Seismic比最先进的基于倒排索引的解决方案快一到两个数量级,并显著优于BigANN 2023挑战赛中获胜的基于图的提交方案。在这项工作中,我们通过为其查询处理子程序引入两项创新来进一步加速Seismic。首先,我们按重要性顺序遍历块,而不是任意顺序。其次,我们获取Seismic检索到的文档列表,并使用离线k-正则最近邻图将其扩展以包含每个文档的邻居;然后对扩展后的列表进行排序以产生最终的top-k集合。在两个公共数据集上的实验表明,我们的扩展版本SeismicWave可以达到几乎精确的准确度水平,并且比Seismic快达2.2倍。

关键词

引用

@article{arxiv.2408.04443,
  title  = {Pairing Clustered Inverted Indexes with kNN Graphs for Fast Approximate Retrieval over Learned Sparse Representations},
  author = {Sebastian Bruch and Franco Maria Nardini and Cosimo Rulli and Rossano Venturini},
  journal= {arXiv preprint arXiv:2408.04443},
  year   = {2024}
}