中文

层次语料编码器:融合生成式检索与稠密索引

信息检索 2025-02-27 v1

摘要

生成式检索利用序列模型基于查询生成文档 ID(如 DSI(Tay 等,2022);NCI(Wang 等,2022)等)。尽管这在零样本检索中取得了改进,但支持训练期未见文档的挑战仍然存在。我们指出,生成式检索的性能依赖于文档层级结构中兄弟节点的对比训练。这激励我们提出层次语料编码器(HCE),其可由传统稠密编码器支持。实验表明,在无监督零样本和监督设置下,HCE 优于生成式检索模型,同时允许轻松添加和移除索引中的文档。

关键词

引用

@article{arxiv.2502.18877,
  title  = {Hierarchical corpus encoder: Fusing generative retrieval and dense indices},
  author = {Tongfei Chen and Ankita Sharma and Adam Pauls and Benjamin Van Durme},
  journal= {arXiv preprint arXiv:2502.18877},
  year   = {2025}
}