中文

面向鲁棒文本检索排序器

信息检索 2022-06-17 v1 计算与语言

摘要

排序器在事实上的“检索与重排”流水线中扮演着不可或缺的角色,但其训练仍显滞后——从中等难度的负样本中学习,和/或作为检索器的辅助模块。本工作中,我们首先识别出构建鲁棒排序器的两大主要障碍,即训练良好的检索器所固有的标签噪声,以及为高性能排序器采样的不理想负样本。为此,我们提出以多个检索器作为负样本生成器来提升排序器的鲁棒性,其中 i) 引入大量分布外标签噪声使排序器能抵御各噪声分布,ii) 来自联合分布的多样困难负样本相对接近排序器的负样本分布,从而带来更具挑战性因而更有效的训练。为评估我们的鲁棒排序器(称为 R2^2anker),我们在流行的段落检索基准上于多种设置下开展实验,包括 BM25-重排、全排序、检索器蒸馏等。实证结果验证了我们的模型达到了新的最先进效果。

关键词

引用

@article{arxiv.2206.08063,
  title  = {Towards Robust Ranker for Text Retrieval},
  author = {Yucheng Zhou and Tao Shen and Xiubo Geng and Chongyang Tao and Can Xu and Guodong Long and Binxing Jiao and Daxin Jiang},
  journal= {arXiv preprint arXiv:2206.08063},
  year   = {2022}
}

备注

11 pages of main content, 4 tables, 3 figures