用于文档检索的神经语料库索引器
信息检索
2023-02-14 v3
摘要
当前最先进的文档检索方案主要遵循索引-检索范式,其中索引难以直接针对最终检索目标进行优化。在本文中,我们旨在表明,一个统一训练与索引阶段的端到端深度神经网络可以显著提升传统方法的召回性能。为此,我们提出神经语料库索引器(NCI),一种为指定查询直接生成相关文档标识符的序列到序列网络。为优化 NCI 的召回性能,我们设计了一种前缀感知权重自适应解码器架构,并利用包括查询生成、语义文档标识符和基于一致性的正则化在内的定制技术。实证研究表明,NCI 在两个常用学术基准上具有优越性,相较于最佳基线方法,在 NQ320k 数据集上的 Recall@1 和 TriviaQA 数据集上的 R-Precision 分别实现了 +21.4% 和 +16.8% 的相对提升。
引用
@article{arxiv.2206.02743,
title = {A Neural Corpus Indexer for Document Retrieval},
author = {Yujing Wang and Yingyan Hou and Haonan Wang and Ziming Miao and Shibin Wu and Hao Sun and Qi Chen and Yuqing Xia and Chengmin Chi and Guoshuai Zhao and Zheng Liu and Xing Xie and Hao Allen Sun and Weiwei Deng and Qi Zhang and Mao Yang},
journal= {arXiv preprint arXiv:2206.02743},
year = {2023}
}
备注
19 pages, 6 figures, accepted by NeurIPS 2022