中文

InPars:利用大型语言模型为信息检索进行数据增强

计算与语言 2022-02-11 v1

摘要

信息检索领域近期因大型预训练Transformer模型而经历了一场变革。这场变革的另一个关键要素是MS MARCO数据集,其规模与多样性使得零样本迁移学习能够应用于多种任务。然而,并非所有信息检索任务和领域都能同等地从单一数据集中获益。大量自然语言处理任务的研究表明,使用领域特定的训练数据(而非通用数据)能提升神经模型的性能。在本工作中,我们利用大型预训练语言模型的少样本能力,将其作为信息检索任务的合成数据生成器。我们证明,仅在我们的无监督数据集上微调的模型,其性能优于BM25等强基线以及近期提出的自监督稠密检索方法。此外,在监督数据和我们的合成数据上共同微调的检索器,其零样本迁移效果优于仅在监督数据上微调的模型。代码、模型和数据可在 https://github.com/zetaalphavector/inpars 获取。

关键词

引用

@article{arxiv.2202.05144,
  title  = {InPars: Data Augmentation for Information Retrieval using Large Language Models},
  author = {Luiz Bonifacio and Hugo Abonizio and Marzieh Fadaee and Rodrigo Nogueira},
  journal= {arXiv preprint arXiv:2202.05144},
  year   = {2022}
}