中文

ScalingNote:利用大语言模型扩规模检索器用于实际密集检索

信息检索 2024-11-26 v1

摘要

密集检索系统大多采用双塔架构进行查询-文档检索。鉴于线上部署需求,现有的实际密集检索系统主要通过设计负采样策略提升性能,忽视了扩规模的潜力。最近,大语言模型(LLM)展现出卓越性能,可被用于扩规模密集检索。然而,扩规模检索模型显著增加线上查询延迟。为此,我们提出ScalingNote—a一种两阶段方法,旨在保持线上查询延迟的同时发挥LLM扩规模潜力。第一阶段训练双塔结构,两个塔均初始化自同一LLM,以释放LLM在密集检索中的潜力。随后,我们仅对查询塔使用均方误差损失和余弦相似度进行蒸馏,以降低线上成本。通过理论分析和全面离线、线上实验,我们展示了ScalingNote的有效性与效率。我们的两阶段扩规模方法优于端到端模型,验证了LLM用于密集检索的扩规模定律在工业场景中的适用性,实现了密集检索系统的经济高效扩规模。集成ScalingNote的线上方法显著提升了检索文档与查询之间的相关性。

关键词

引用

@article{arxiv.2411.15766,
  title  = {ScalingNote: Scaling up Retrievers with Large Language Models for Real-World Dense Retrieval},
  author = {Suyuan Huang and Chao Zhang and Yuanyuan Wu and Haoxin Zhang and Yuan Wang and Maolin Wang and Shaosheng Cao and Tong Xu and Xiangyu Zhao and Zengchang Qin and Yan Gao and Yunhan Bai and Jun Fan and Yao Hu and Enhong Chen},
  journal= {arXiv preprint arXiv:2411.15766},
  year   = {2024}
}