中文

如何训练你的 DRAGON:面向可泛化稠密检索的多样化增强

信息检索 2023-02-16 v1 计算与语言

摘要

近年来已开发多种技术以改进稠密检索(DR),如非监督对比学习与伪查询生成。然而,现有 DR 常在监督检索与零样本检索的效果之间存在权衡,有人认为这源于有限的模型容量。我们反驳该假设,并表明可在不增大模型尺寸的情况下训练出在监督与零样本检索中均达高精度的可泛化 DR。具体而言,我们在数据增强(DA)框架下系统考察 DR 的对比学习。我们的研究表明,常见的 DA 做法(如用生成模型进行查询增强、用交叉编码器创建伪相关标签)往往低效且次优。因此我们提出一种具有多样化查询与监督来源的新的 DA 方法,以渐进式训练可泛化 DR。由此,经多样化增强训练的稠密检索器 DRAGON 成为首个在监督与零样本评测中均达最先进效果且为 BERT-base 尺寸的 DR,甚至可与采用更复杂后期交互的模型(ColBERTv2 与 SPLADE++)相竞争。

关键词

引用

@article{arxiv.2302.07452,
  title  = {How to Train Your DRAGON: Diverse Augmentation Towards Generalizable Dense Retrieval},
  author = {Sheng-Chieh Lin and Akari Asai and Minghan Li and Barlas Oguz and Jimmy Lin and Yashar Mehdad and Wen-tau Yih and Xilun Chen},
  journal= {arXiv preprint arXiv:2302.07452},
  year   = {2023}
}