基于嵌入的零样本检索:通过查询生成实现
信息检索
2020-09-23 v1
摘要
段落检索旨在给定查询时从通常较大的语料库中定位相关段落。在实践中,由于效率优势,BM25 等词汇项匹配算法是检索的流行选择。然而,基于词的匹配算法常常遗漏与查询无词汇重叠的相关段落,且无法针对下游数据集进行微调。在这项工作中,我们将基于嵌入的双塔架构作为我们的神经检索模型。由于标注数据可能稀缺,且神经检索模型需要大量数据进行训练,我们提出了一种用于生成检索合成训练数据的新方法。我们的系统取得了显著结果,在测试的 6 个数据集中有 5 个大幅优于 BM25,Recall@1 平均高出 2.45 个点。在某些情况下,我们的模型在合成数据上训练甚至优于在相同真实数据上训练的模型。
引用
@article{arxiv.2009.10270,
title = {Embedding-based Zero-shot Retrieval through Query Generation},
author = {Davis Liang and Peng Xu and Siamak Shakeri and Cicero Nogueira dos Santos and Ramesh Nallapati and Zhiheng Huang and Bing Xiang},
journal= {arXiv preprint arXiv:2009.10270},
year = {2020}
}