中文

构建基于树的索引以实现高效且有效的稠密检索

信息检索 2023-04-27 v1 计算与语言

摘要

近期研究表明,稠密检索(DR)技术可显著改善 IR 系统中第一阶段检索的性能。尽管具有经验有效性,DR 的应用仍受限。与依赖高效倒排索引方案的统计检索模型不同,DR 模型构建的稠密嵌入难以用多数现有搜索索引系统预处理。为避免暴力搜索的高昂代价,近似最近邻(ANN)算法及相应索引被广泛用于加速 DR 模型的推理过程。遗憾的是,虽然 ANN 可提升 DR 模型的效率,通常却以检索性能显著下降为代价。为解决此问题,我们提出 JTR,即基于树的索引与查询编码的联合优化(Joint optimization of TRee-based index and query encoding)。具体而言,我们设计了一种新的统一对比学习损失,以端到端方式训练基于树的索引与查询编码器。采用基于树的负采样策略使树具备最大堆性质,从而良好支持束搜索的有效性。此外,我们将簇分配视为优化问题来更新允许重叠聚类的基于树的索引。我们在众多流行检索基准上评估 JTR。实验结果表明,与广泛采用的基线相比,JTR 在保持高系统效率的同时实现了更优检索性能,为神经检索系统设计中效率与有效性的平衡提供了潜在方案。

关键词

引用

@article{arxiv.2304.11943,
  title  = {Constructing Tree-based Index for Efficient and Effective Dense Retrieval},
  author = {Haitao Li and Qingyao Ai and Jingtao Zhan and Jiaxin Mao and Yiqun Liu and Zheng Liu and Zhao Cao},
  journal= {arXiv preprint arXiv:2304.11943},
  year   = {2023}
}

备注

10 pages, accepted at SIGIR 2023