通过精细伪相关标注的自监督进行稠密检索与会话式稠密检索的领域自适应
信息检索
2024-03-15 v1
摘要
近期的研究表明,稠密检索模型泛化到具有不同分布的目标领域的能力是有限的,这与基于交互的模型所获得的结果形成对比。先前为缓解这一挑战所做的尝试涉及利用对抗学习和查询生成方法,但这两种方法均仅带来有限的改进。在本文中,我们提出将查询生成方法与自监督方法相结合,在目标领域上自动生成伪相关标签。为实现这一点,利用 T5-3B 模型进行伪正例标注,并精心挑选难负例。我们还将此策略应用于会话式稠密检索模型以进行会话式搜索。使用了类似的伪标注方法,但增加了一个查询重写模块,以重写会话式查询供后续标注使用。所提出的方法利用目标数据集中的真实查询和文档实现了模型的领域自适应。在标准稠密检索和会话式稠密检索模型上的实验均表明,在伪相关标注数据上进行微调后,基线模型均有所提升。
引用
@article{arxiv.2403.08970,
title = {Domain Adaptation for Dense Retrieval and Conversational Dense Retrieval through Self-Supervision by Meticulous Pseudo-Relevance Labeling},
author = {Minghan Li and Eric Gaussier},
journal= {arXiv preprint arXiv:2403.08970},
year = {2024}
}
备注
12 pages, accepted by COLING 2024