查询扩展能否提升强交叉编码器排序器的泛化能力?
信息检索
2024-05-01 v2 人工智能
摘要
查询扩展已被广泛用于改善第一阶段检索器的搜索结果,但其对第二阶段交叉编码器排序器的影响仍未被充分探索。Weller 等人 [44] 的近期工作表明,当前的扩展技术有益于 DPR 和 BM25 等较弱模型,却会损害 MonoT5 等较强排序器。本文重新审视该结论并提出以下问题:查询扩展能否改善强交叉编码器排序器的泛化能力?为回答此问题,我们首先将流行的查询扩展方法应用于最先进的交叉编码器排序器,并验证了退化的零样本性能。我们在实验中识别出交叉编码器的两个关键步骤:高质量关键词生成与最小干扰式查询修改。我们表明,通过提示工程并借助融合聚合各扩展查询的排序结果,有可能改善强神经排序器的泛化能力。具体而言,我们首先调用指令遵循语言模型经由推理链生成关键词。利用自一致性与倒数排名加权,我们进一步动态结合各扩展查询的排序结果。在 BEIR 与 TREC Deep Learning 2019/2020 上的实验表明,遵循这些步骤后 MonoT5 与 RankT5 的 nDCG@10 分数均得到提升,这为将查询扩展应用于强交叉编码器排序器指明了方向。
引用
@article{arxiv.2311.09175,
title = {Can Query Expansion Improve Generalization of Strong Cross-Encoder Rankers?},
author = {Minghan Li and Honglei Zhuang and Kai Hui and Zhen Qin and Jimmy Lin and Rolf Jagerman and Xuanhui Wang and Michael Bendersky},
journal= {arXiv preprint arXiv:2311.09175},
year = {2024}
}