中文

大型双编码器是可泛化的检索器

信息检索 2021-12-16 v1 计算与语言

摘要

已有研究表明,在一个领域上训练的双编码器在检索任务中往往无法泛化到其他领域。一种普遍看法是,双编码器的瓶颈层(最终得分仅是查询向量与段落向量的点积)过于受限,不足以使双编码器成为有效的域外泛化检索模型。本文中,我们挑战这一看法,在保持瓶颈嵌入大小固定的同时扩大双编码器模型的规模。通过多阶段训练,令人惊讶的是,扩大模型规模在各种检索任务上带来了显著提升,尤其是域外泛化。实验结果表明,我们的双编码器,即基于T5的可泛化稠密检索器(Generalizable T5-based dense Retrievers, GTR),在BEIR数据集上显著优于ColBERT及现有的稀疏与稠密检索器。最令人惊讶的是,我们的消融研究发现GTR非常数据高效,仅需10%的MS Marco监督数据即可达到最佳域外性能。所有GTR模型发布于https://tfhub.dev/google/collections/gtr/1。

关键词

引用

@article{arxiv.2112.07899,
  title  = {Large Dual Encoders Are Generalizable Retrievers},
  author = {Jianmo Ni and Chen Qu and Jing Lu and Zhuyun Dai and Gustavo Hernández Ábrego and Ji Ma and Vincent Y. Zhao and Yi Luan and Keith B. Hall and Ming-Wei Chang and Yinfei Yang},
  journal= {arXiv preprint arXiv:2112.07899},
  year   = {2021}
}