中文

通过伪相关标注自监督实现稠密检索的域自适应

信息检索 2022-12-14 v1

摘要

尽管神经信息检索取得了巨大进展,近期研究表明稠密检索模型在具有不同分布的目标域上的泛化能力有限,这与基于交互的模型所得结果形成对比。为解决此问题,研究者求助于对抗式学习与查询生成方法;然而这两类方法的改进均有限。本文提出一种自监督方法,在目标域上自动生成伪相关标注。为此,我们首先在目标域上使用标准 BM25 模型获得文档的初步排序,随后使用基于交互的模型 T53B 对顶部文档重新排序。我们进一步将该方法与依赖于在源域上训练的基于交互的教师模型的知识蒸馏相结合。实验表明,使用 T53B 与 MiniLM 教师的伪相关标注平均优于其他方法,并且当在伪相关标注数据上微调时,有助于改进最先进的查询生成方法 GPL。

关键词

引用

@article{arxiv.2212.06552,
  title  = {Domain Adaptation for Dense Retrieval through Self-Supervision by Pseudo-Relevance Labeling},
  author = {Minghan Li and Eric Gaussier},
  journal= {arXiv preprint arXiv:2212.06552},
  year   = {2022}
}

备注

16 pages