中文

InPars-v2:作为信息检索高效数据集生成器的大语言模型

信息检索 2023-05-30 v4 人工智能

摘要

近来,InPars引入了一种在信息检索任务中高效使用大语言模型(LLMs)的方法:通过少样本示例,诱导LLM为文档生成相关查询。这些合成的查询-文档对随后可用于训练检索器。然而,InPars以及更近的Promptagator依赖于如GPT-3和FLAN等专有LLM来生成此类数据集。本工作中我们引入InPars-v2,一种使用开源LLM与现有强大重排器来选择用于训练的合成查询-文档对的数据集生成器。一个简单的BM25检索流水线后接在InPars-v2数据上微调的monoT5重排器,在BEIR基准上取得了新的最先进结果。为让研究者进一步改进我们的方法,我们开源了代码、合成数据与微调模型:https://github.com/zetaalphavector/inPars/tree/master/tpu

关键词

引用

@article{arxiv.2301.01820,
  title  = {InPars-v2: Large Language Models as Efficient Dataset Generators for Information Retrieval},
  author = {Vitor Jeronymo and Luiz Bonifacio and Hugo Abonizio and Marzieh Fadaee and Roberto Lotufo and Jakub Zavrel and Rodrigo Nogueira},
  journal= {arXiv preprint arXiv:2301.01820},
  year   = {2023}
}