中文

HARNESS-LM:用于提取小型语言模型在赞助搜索检索中的潜能的三阶段训练配方

信息检索 2026-05-25 v1 人工智能 机器学习

摘要

在赞助搜索的激烈竞争环境中,在检索质量和生产延迟之间取得平衡是一项关键挑战。虽然基于小型语言模型(SLMs)的大型检索模型,如 Qwen3-Embedding-4B/8B 在公共基准测试中取得了强劲的上限,但其在高吞吐量、延迟敏感的环境中的部署仍然不可行。本文提出了 HARNESS-LM(HLM),一个用于将大规模检索器能力迁移到紧凑、高性价比模型的三阶段训练框架。该方法包括:(1)通过微调十亿参数规模的 SLM 来训练高性能参考检索器("教师");(2)通过 L2 目标对查询表示进行对齐,以将知识蒸馏到亚 600 万参数的学生编码器中;(3)应用最终的对比微调阶段,以优化学生模型以实现检索性能。我们还present了一个全面的实证研究,探讨了关键设计选择,包括对齐目标、嵌入维度、模型规模、架构和优化策略,以识别在生产环境中最有效的配置。在真实世界的 Bing Ads 评估基准测试中,HLM 在多种设置下恢复了超过 98% 的参考检索器精度,同时在 NVIDIA A100 GPU 上实现了最高 27 倍的在线查询编码器延迟降低和 20 倍的吞吐量提升。在 Bing Ads 上的在线 A/B 测试显示,部署 1.9 亿参数模型后,相较于当前在生产中运行的检索器集合,实现了 +1% 收入提升、+0.6% 曝光量提升和 +0.4% 点击率提升,明确凸显了 HLM 配方在真实世界的赞助搜索场景中的实际有效性。

关键词

引用

@article{arxiv.2605.23572,
  title  = {HARNESS-LM: A Three-Phase Training Recipe for Harnessing SLMs in Sponsored Search Retrieval},
  author = {Vipul Gupta and Shikhar Mohan and Lakshya Kumar and Pranjal Chitale and Nikit Begwani and Amit Singh and Manik Varma},
  journal= {arXiv preprint arXiv:2605.23572},
  year   = {2026}
}

备注

9 pages, 3 figures, 10 tables