中文

基于深度语言模型和密集检索器的伪相关反馈:成功与陷阱

信息检索 2022-07-04 v2

摘要

伪相关反馈(PRF)已知能提升词袋检索器的有效性。同时,深度语言模型已被证明优于传统的词袋重排序器。然而,如何将PRF直接与新兴的深度语言模型集成尚不清楚。本文通过研究将PRF信号集成到基于深度语言模型的重排序器和密集检索器中的方法,来填补这一空白。我们考虑了基于文本和基于向量的PRF方法,并研究了组合和评分相关性信号的不同方式。在四个不同数据集和两种任务设置(检索和排序)上进行了广泛的实证评估。基于文本的PRF结果表明,PRF的使用对不同数据集上的深度重排序器产生了混合效果。我们发现,当(i)将每个PRF段落直接与查询拼接,用新的查询集进行搜索,然后聚合分数;(ii)使用Borda法聚合来自PRF运行的分数时,取得了最佳有效性。基于向量的PRF结果表明,PRF的使用在多个评估指标上提升了深度重排序器和密集检索器的有效性。我们发现,当(i)查询在PRF机制中保留大部分或相同的权重,以及(ii)采用较浅的PRF信号(即较少数量的排名靠前段落)而非较深的信号时,取得了更高的有效性。我们的基于向量的PRF方法计算效率高;因此,这代表了一种通用的PRF方法,可供其他人在深度重排序器和密集检索器中使用。

关键词

引用

@article{arxiv.2108.11044,
  title  = {Pseudo Relevance Feedback with Deep Language Models and Dense Retrievers: Successes and Pitfalls},
  author = {Hang Li and Ahmed Mourad and Shengyao Zhuang and Bevan Koopman and Guido Zuccon},
  journal= {arXiv preprint arXiv:2108.11044},
  year   = {2022}
}

备注

Accepted to the Journal of ACM Transactions on Information Systems (TOIS)