不要检索,直接生成:使用 LLM 为密集检索生成合成训练数据
信息检索
2026-05-12 v4 计算与语言
摘要
训练高效的密集检索模型通常依赖于从大型文档语料库中使用如 BM25 或 cross-encoder 等方法挖掘的硬负例(hard negative),这些方法需要完整的语料库访问和昂贵的索引构建。我们提出直接从提供的查询和正文段落生成合成硬负例,使用大语言模型(LLM)。我们使用由四种最先进的 LLM(从 4B 到 30B 参数)生成的合成负例对 DistilBERT 进行微调,并在 10 个 BEIR 基准数据集上进行评估。与主流观点相反,我们发现我们的生成管道持续低于传统的语料库基于挖掘策略(BM25 和 Cross-Encoder)。此外,我们观察到扩大生成模型并不单调提高检索性能,发现 14B 参数模型在某些情况下优于 30B 参数模型且在部分场景中表现最差。
引用
@article{arxiv.2504.21015,
title = {Don't Retrieve, Generate: Prompting LLMs for Synthetic Training Data in Dense Retrieval},
author = {Aarush Sinha},
journal= {arXiv preprint arXiv:2504.21015},
year = {2026}
}