中文

基于大语言模型的淘宝搜索长尾查询改写

信息检索 2024-03-05 v3

摘要

在电商搜索领域,语义匹配的重要性不言而喻,因为它直接影响用户体验与公司营收。在此方向上,查询改写作为弥合语义匹配过程中固有语义鸿沟的重要技术,受到了工业界与学术界的广泛关注。然而,现有的查询改写方法往往难以有效优化长尾查询,并缓解由语义鸿沟引发的“低召回”现象。本文中,我们提出 BEQUE,一个为长尾查询弥合语义鸿沟(Bridges the sEmantic gap for long-tail QUEries)的综合框架。具体而言,BEQUE 包含三个阶段:多指令监督微调(SFT)、离线反馈与目标对齐。我们首先基于拒绝采样与辅助任务混合构建改写数据集,以监督方式微调我们的大语言模型(LLM)。随后,利用训练良好的 LLM,我们采用束搜索生成多个候选改写,并将其输入淘宝离线系统以获得偏序关系。借助改写的偏序,我们引入对比学习方法以凸显改写间的差异,并使模型与淘宝线上目标对齐。离线实验证明了我们的方法在弥合语义鸿沟上的有效性。线上 A/B 测试显示,我们的方法能显著提升长尾查询的商品交易总额(GMV)、交易笔数(#Trans)与独立访客数(UV)。BEQUE 已于 2023 年 10 月部署于中国最受欢迎的在线购物平台之一——淘宝。

关键词

引用

@article{arxiv.2311.03758,
  title  = {Large Language Model based Long-tail Query Rewriting in Taobao Search},
  author = {Wenjun Peng and Guiyang Li and Yue Jiang and Zilong Wang and Dan Ou and Xiaoyi Zeng and Derong Xu and Tong Xu and Enhong Chen},
  journal= {arXiv preprint arXiv:2311.03758},
  year   = {2024}
}

备注

WWW Industry