面向稀疏、稠密与学习型稀疏检索的生成式与伪相关反馈
信息检索
2023-05-15 v1
摘要
伪相关反馈(PRF)是一种经典方法,通过利用首轮检索结果来丰富查询以解决词汇不匹配问题。此外,近期关于生成式相关反馈(GRF)的研究表明,使用大语言模型生成的文本进行查询扩展的模型能够改善稀疏检索,且无需依赖首轮检索效果。本文通过六个标准文档排序基准上的实验,将GRF扩展到稠密与学习型稀疏检索范式。我们发现,在面向精度和召回的评测指标上,GRF相较可比的PRF技术均有约10%的提升。尽管如此,查询分析表明GRF与PRF具有互补的优势:GRF提供首轮检索中不存在的外部上下文,而PRF将查询锚定于目标语料所含的信息。因此,我们提出融合生成式与伪相关反馈的排序信号,以兼得两类反馈之长,这在95%的实验中显著提升了相对PRF方法的召回率。
引用
@article{arxiv.2305.07477,
title = {Generative and Pseudo-Relevant Feedback for Sparse, Dense and Learned Sparse Retrieval},
author = {Iain Mackie and Shubham Chatterjee and Jeffrey Dalton},
journal= {arXiv preprint arXiv:2305.07477},
year = {2023}
}