面向鲁棒文本检索排序器
信息检索
2022-06-17 v1 计算与语言
摘要
排序器在事实上的“检索与重排”流水线中扮演着不可或缺的角色,但其训练仍显滞后——从中等难度的负样本中学习,和/或作为检索器的辅助模块。本工作中,我们首先识别出构建鲁棒排序器的两大主要障碍,即训练良好的检索器所固有的标签噪声,以及为高性能排序器采样的不理想负样本。为此,我们提出以多个检索器作为负样本生成器来提升排序器的鲁棒性,其中 i) 引入大量分布外标签噪声使排序器能抵御各噪声分布,ii) 来自联合分布的多样困难负样本相对接近排序器的负样本分布,从而带来更具挑战性因而更有效的训练。为评估我们的鲁棒排序器(称为 Ranker),我们在流行的段落检索基准上于多种设置下开展实验,包括 BM25-重排、全排序、检索器蒸馏等。实证结果验证了我们的模型达到了新的最先进效果。
引用
@article{arxiv.2206.08063,
title = {Towards Robust Ranker for Text Retrieval},
author = {Yucheng Zhou and Tao Shen and Xiubo Geng and Chongyang Tao and Can Xu and Guodong Long and Binxing Jiao and Daxin Jiang},
journal= {arXiv preprint arXiv:2206.08063},
year = {2022}
}
备注
11 pages of main content, 4 tables, 3 figures