MAKE:基于视觉-语言预训练的商品检索在淘宝搜索中的应用
信息检索
2023-02-21 v2
摘要
淘宝搜索包含两个阶段:检索阶段与排序阶段。给定用户查询,检索阶段为后续排序阶段返回候选商品子集。近年来,预训练与微调范式在将视觉线索融入检索任务方面展现出潜力。本文聚焦于解决淘宝搜索中的文本到多模态检索问题。我们认为用户对不同商品的标题或图像的关注程度各异,因此提出一种新颖的模态自适应模块用于跨模态融合,帮助跨商品为文本与图像分配恰当权重。此外,在电商搜索中,用户查询往往简短,导致用户查询与商品标题间存在显著语义失衡。为此,我们设计独立的文本编码器与关键词增强机制,以丰富查询表征并改善文本到多模态匹配。基于此,我们提出一种新颖的视觉-语言(V+L)预训练方法,以利用(用户查询、商品标题、商品图像)的多模态信息。大量实验表明,我们的检索专用预训练模型(称为 MAKE)在文本到多模态检索任务上优于现有 V+L 预训练方法。MAKE 已在线部署,并为淘宝搜索的检索系统带来显著改进。
引用
@article{arxiv.2301.12646,
title = {MAKE: Vision-Language Pre-training based Product Retrieval in Taobao Search},
author = {Xiaoyang Zheng and Zilong Wang and Ke Xu and Sen Li and Tao Zhuang and Qingwen Liu and Xiaoyi Zeng},
journal= {arXiv preprint arXiv:2301.12646},
year = {2023}
}
备注
5 pages, accepted to The Industry Track of the Web Conference 2023