中文

UDAPDR:基于LLM提示与重排器蒸馏的无监督域适应

信息检索 2023-10-16 v3 计算与语言

摘要

许多信息检索任务需要大型标注数据集进行微调。然而,此类数据集常常不可用,且由于域偏移,它们对实际应用的效用可能迅速降低。为应对这一挑战,我们开发并论证了一种利用大语言模型(LLMs)廉价生成大量合成查询的方法。该方法首先使用昂贵的 LLM 生成少量合成查询;此后,使用一个成本低得多的 LLM 创建大量合成查询,用于微调一系列重排器模型。这些重排器随后被蒸馏为一个高效检索器,用于目标域。我们表明,该技术提升了长尾域中的零样本准确率,并实现了比标准重排序方法明显更低的延迟。

关键词

引用

@article{arxiv.2303.00807,
  title  = {UDAPDR: Unsupervised Domain Adaptation via LLM Prompting and Distillation of Rerankers},
  author = {Jon Saad-Falcon and Omar Khattab and Keshav Santhanam and Radu Florian and Martin Franz and Salim Roukos and Avirup Sil and Md Arafat Sultan and Christopher Potts},
  journal= {arXiv preprint arXiv:2303.00807},
  year   = {2023}
}

备注

Long Paper at Empirical Methods in Natural Language Processing (EMNLP) 2023