AugTriever:基于可扩展数据增强的无监督稠密检索与领域自适应
计算与语言
2024-10-31 v4 信息检索
摘要
稠密检索器在文本检索和开放域问答方面取得了显著进展。然而,这些成就大多严重依赖于大量人工标注的监督。在本研究中,我们旨在开发用于改进稠密检索模型的无监督方法。我们提出了两种通过创建伪查询-文档对来实现无标注且可扩展训练的方法:查询抽取与迁移查询生成。查询抽取方法从原始文档中选取显著片段来生成伪查询。另一方面,迁移查询生成方法利用为其他NLP任务(如摘要)训练的生成模型来产生伪查询。通过大量实验,我们证明使用这些增强方法训练的模型能够达到与多个强稠密基线相当甚至更优的性能。此外,组合这些策略可带来进一步的提升,从而在BEIR和ODQA数据集上基准测试的无监督稠密检索、无监督领域自适应和有监督微调方面取得更优性能。代码与数据集公开于 https://github.com/salesforce/AugTriever。
引用
@article{arxiv.2212.08841,
title = {AugTriever: Unsupervised Dense Retrieval and Domain Adaptation by Scalable Data Augmentation},
author = {Rui Meng and Ye Liu and Semih Yavuz and Divyansh Agarwal and Lifu Tu and Ning Yu and Jianguo Zhang and Meghana Bhat and Yingbo Zhou},
journal= {arXiv preprint arXiv:2212.08841},
year = {2024}
}
备注
DCAI24, October 25, 2024, Boise, ID