中文

基于语料图的自适应重排序

信息检索 2022-08-19 v1

摘要

搜索系统通常采用重排序流水线,其中来自初始候选池的文档(或段落)被赋予新的排序分数。该过程使得能够使用高效但昂贵的评分函数,这些函数不适合直接用于倒排索引或近似最近邻索引等结构中。然而,重排序流水线固有地受限于初始候选池的召回率;未被初始检索函数识别为重排序候选的文档无法被识别。我们提出一种基于成熟的聚类假设来克服召回限制的新方法。在整个重排序过程中,我们的方法将与该时刻最高分文档最相似的文档加入池中。这一反馈过程使候选池适应于那些也可能产生高排序分数的文档,即使它们未出现在初始池中。它还可以提高池中位置较深的文档的分数,否则这些文档会因有限的重排序预算而被跳过。我们发现,我们的基于图的自适应重排序(GAR)方法在精确率和召回率导向的指标上显著提升了重排序流水线的性能,与多种现有技术(例如稠密检索)互补,对其超参数具有鲁棒性,并且对计算和存储成本增加极少。例如,在 MS MARCO 段落排序数据集上,GAR 在应用 monoT5 ranker 时可将 BM25 候选池的 nDCG 提高至多 8%。

关键词

引用

@article{arxiv.2208.08942,
  title  = {Adaptive Re-Ranking with a Corpus Graph},
  author = {Sean MacAvaney and Nicola Tonellotto and Craig Macdonald},
  journal= {arXiv preprint arXiv:2208.08942},
  year   = {2022}
}

备注

CIKM 2022