规模化成功:多租户搜索的自动化数据集构建与查询侧自适应
信息检索
2026-03-05 v3 人工智能
计算与语言
机器学习
摘要
大规模多租户检索系统产生了大量的查询日志,但缺乏用于有效领域自适应的精选相关性标签,导致大量未被充分利用的“暗数据”。由于联合微调查询和文档编码器需要全语料库重新索引,模型更新的高成本加剧了这一挑战,这在具有数千个独立索引的多租户设置中是不切实际的。我们引入了 DevRev-Search,这是一个通过全自动流水线构建的面向技术客户支持的段落检索基准。候选生成使用跨多种稀疏和密集检索器的融合,随后利用 LLM-as-a-Judge 进行一致性过滤和相关性标注。我们进一步提出了一种索引保留自适应策略,仅微调查询编码器,在保持文档索引固定不变的同时实现了显著的性能提升。在 DevRev-Search、SciFact 和 FiQA-2018 上的实验表明,查询编码器的参数高效微调(PEFT)提供了卓越的质量-效率权衡,实现了可扩展且实用的企业搜索自适应。
引用
@article{arxiv.2601.04646,
title = {Succeeding at Scale: Automated Dataset Construction and Query-Side Adaptation for Multi-Tenant Search},
author = {Prateek Jain and Shabari S Nair and Ritesh Goru and Prakhar Agarwal and Ajay Yadav and Yoga Sri Varshan Varadharajan and Constantine Caramanis},
journal= {arXiv preprint arXiv:2601.04646},
year = {2026}
}