中文

启动与切换:用于零样本稠密检索的交替蒸馏

计算与语言 2023-11-28 v1 信息检索

摘要

神经“稠密”检索模型在许多数据集上处于最先进水平,然而这些模型常表现出有限的领域迁移能力。现有的适配方法笨重,例如需要显式监督、复杂模型架构或大规模外部模型。我们提出 ABEL\texttt{ABEL},一种简单而有效的无监督方法,用于增强零样本设置下的段落检索。我们的技术遵循一个直接循环:稠密检索器从重排器提供的监督信号中学习,随后重排器基于改进检索器的反馈进行更新。通过迭代该循环,两个组件相互提升彼此性能。实验结果表明,我们的无监督 ABEL\texttt{ABEL} 模型在 BEIR 基准上优于领先的有监督与无监督检索器。同时,它对训练时未见的任务和领域展现出强适配能力。通过对 ABEL\texttt{ABEL} 进行标注数据微调或将其与现有有监督稠密检索器集成,我们取得了最先进的结果。\footnote{源代码见 \url{https://github.com/Fantabulous-J/BootSwitch}。}

关键词

引用

@article{arxiv.2311.15564,
  title  = {Boot and Switch: Alternating Distillation for Zero-Shot Dense Retrieval},
  author = {Fan Jiang and Qiongkai Xu and Tom Drummond and Trevor Cohn},
  journal= {arXiv preprint arXiv:2311.15564},
  year   = {2023}
}

备注

Accepted by EMNLP 2023 Findings