中文

DRAMA:从大语言模型生成多样化增强数据以训练更小的稠密检索器

计算与语言 2025-06-04 v2 信息检索

摘要

大语言模型(LLM)在作为稠密检索器进行微调后显示出强大的有效性与鲁棒性,但其庞大的参数规模带来了显著的推理时延计算挑战,包括大规模语料库的高编码成本以及查询延迟的增加,限制了其实际部署。虽然较小的检索器具有更好的效率,但往往缺乏足够的监督式微调数据便无法有效泛化。在本文中,我们引入 DRAMA,一套训练框架,利用 LLM 来训练更小且具泛化能力的稠密检索器。具体而言,我们采用剪枝后的 LLM 作为骨干网络,在单阶段对比学习中训练于多样化的 LLM 增强数据。实验表明,DRAMA 在多语言和长文本情境下的能力均优于传统基于编码器的检索器,并在多个任务和语言上实现卓越的性能。这些结果凸显了通过连接更小检索器的训练与 LLM 的不断进步之间的潜力,弥合了效率与泛化能力之间的鸿沟。

关键词

引用

@article{arxiv.2502.18460,
  title  = {DRAMA: Diverse Augmentation from Large Language Models to Smaller Dense Retrievers},
  author = {Xueguang Ma and Xi Victoria Lin and Barlas Oguz and Jimmy Lin and Wen-tau Yih and Xilun Chen},
  journal= {arXiv preprint arXiv:2502.18460},
  year   = {2025}
}

备注

ACL 2025