EHI:面向高效稠密检索的端到端分层索引学习
机器学习
2024-10-15 v2 信息检索
摘要
基于稠密嵌入的检索被广泛用于语义搜索与排序。然而,传统的两阶段方法(先对比嵌入学习,再进行近似最近邻搜索(ANNS))可能存在两个阶段之间的错位问题,这种失配会降低检索性能。我们提出端到端分层索引(EHI),一种通过联合优化嵌入生成与 ANNS 结构来直接解决该问题的新方法。EHI 利用双编码器对查询与文档进行嵌入,同时学习一种倒排文件索引(IVF)风格树结构。为促进该离散结构的有效学习,EHI 引入稠密路径嵌入,对查询与文档在树中所经路径进行编码。在包括 MS MARCO(Dev 集)与 TREC DL19 在内的标准基准上的大量评测表明,EHI 优于传统 ANNS 索引。在相同计算约束下,EHI 在 MS MARCO(Dev)上的 MRR@10 比现有最优方法高出 +1.45%,在 TREC DL19 上的 nDCG@10 高出 +8.2%,凸显了我们端到端方法的优势。
引用
@article{arxiv.2310.08891,
title = {EHI: End-to-end Learning of Hierarchical Index for Efficient Dense Retrieval},
author = {Ramnath Kumar and Anshul Mittal and Nilesh Gupta and Aditya Kusupati and Inderjit Dhillon and Prateek Jain},
journal= {arXiv preprint arXiv:2310.08891},
year = {2024}
}