中文

为生成伪标记域适应重新寻找硬负样本

信息检索 2025-01-27 v1 机器学习

摘要

稠密检索器已显示出在神经信息检索中显著的潜力;然而,它们对域偏移缺乏鲁棒性,从而限制了其在零样本设置下跨多样化域的有效性。生成伪标记 (GPL) 是一种最先进的域适应技术。GPL 使用合成查询生成和最初挖掘的硬负样本,从而在目标域中从 cross-encoder 蒸馏知识到稠密检索器。本文分析了域适应模型检索的文档,并发现这些文档与非域适应模型检索的文档相比更相关于目标查询。我们随后提出在知识蒸馏阶段刷新硬负样本索引,以挖掘更好的硬负样本。我们的重新挖掘 R-GPL 方法在 13/14 个 BEIR 数据集和 9/12 个 LoTTe 数据集上提升了排序性能。我们的贡献包括 (i)分析域适应和非域适应模型返回的硬负样本,以及 (ii)在 LoTTE 和 BEIR 数据集上应用带或不带硬负样本重新挖掘的 GPL 训练。

关键词

引用

@article{arxiv.2501.14434,
  title  = {Remining Hard Negatives for Generative Pseudo Labeled Domain Adaptation},
  author = {Goksenin Yuksel and David Rau and Jaap Kamps},
  journal= {arXiv preprint arXiv:2501.14434},
  year   = {2025}
}