大型语言模型作为下一代稠密检索的基石:全面实证评估
计算与语言
2024-08-26 v2
摘要
预训练语言模型如 BERT 和 T5 作为稠密检索的关键 backbone 编码器发挥着重要作用。然而,这些模型往往表现出有限的泛化能力,并面临在领域内准确率提升方面的挑战。近期研究探索将大型语言模型(LLM)作为检索器,实现了在各种任务上的 SOTA 性能。尽管取得了这些进展,但 LLM 相较于传统检索器的具体优势,以及不同 LLM 配置(如参数规模、预训练时长和对齐过程)对检索任务的影响仍不明确。本文我们对广泛的检索任务进行全面实证研究,包括领域内准确率、数据效率、零样本泛化、长文本检索、指令式检索和多任务学习。我们评估了超过 15 个不同的 backbone LLM 和非 LLM。我们的发现表明,更大的模型和更长的预训练在提升领域内准确率和数据效率方面表现一致。此外,更大的模型在零样本泛化、长文本检索、指令式检索和多任务学习方面展现出显著潜力。这些结果凸显了 LLM 作为稠密检索中灵活且高效的 backbone 编码器的优势,为该领域的未来研究和开发提供了宝贵见解。
引用
@article{arxiv.2408.12194,
title = {Large Language Models as Foundations for Next-Gen Dense Retrieval: A Comprehensive Empirical Assessment},
author = {Kun Luo and Minghao Qin and Zheng Liu and Shitao Xiao and Jun Zhao and Kang Liu},
journal= {arXiv preprint arXiv:2408.12194},
year = {2024}
}
备注
Submitted to EMNLP24