Promptagator:基于8个样本的少样本稠密检索
计算与语言
2022-09-26 v1 信息检索
摘要
近期许多信息检索研究聚焦于如何从一个任务(通常具有丰富监督数据)迁移到各种监督有限的任务,其隐含假设是能从单一任务泛化至其余所有任务。然而,这忽略了存在众多多样且独特的检索任务,各自针对不同的搜索意图、查询和检索领域。本文提出研究少样本稠密检索(Few-shot Dense Retrieval),该设定下每个任务附带简短描述与少量示例。为放大少量示例的效用,我们提出基于提示的查询生成检索器(Promptagator),其利用大语言模型(LLM)作为少样本查询生成器,并基于生成数据构建任务专属检索器。借助LLM的泛化能力,Promptagator仅基于少量示例即可创建任务专属端到端检索器,而{无需}使用Natural Questions或MS MARCO来训练问题生成器或双编码器。令人惊讶的是,不超过8个示例的LLM提示即可使双编码器在11个检索集上平均nDCG超越基于MS MARCO训练的重度工程化模型(如ColBERT v2)逾1.2。进一步使用相同生成数据训练标准规模重排序器可再带来5.0个nDCG点的提升。我们的研究确定,查询生成可能远比此前观测有效,尤其在给定少量任务专属知识时。
引用
@article{arxiv.2209.11755,
title = {Promptagator: Few-shot Dense Retrieval From 8 Examples},
author = {Zhuyun Dai and Vincent Y. Zhao and Ji Ma and Yi Luan and Jianmo Ni and Jing Lu and Anton Bakalov and Kelvin Guu and Keith B. Hall and Ming-Wei Chang},
journal= {arXiv preprint arXiv:2209.11755},
year = {2022}
}