中文

面向可扩展基于嵌入检索的渐进优化双粒度文档表示

信息检索 2022-03-03 v3 人工智能 计算与语言

摘要

Ad-hoc 搜索需要从海量语料中选取恰当答案。如今,基于嵌入的检索(EBR)成为一种颇具前景的方案,其将基于深度学习的文档表示与 ANN 搜索技术相结合以处理该任务。然而,一个主要挑战在于,鉴于答案语料规模可观,ANN 索引可能过大而无法装入内存。本工作中,我们以双粒度文档表示应对此问题:轻量级稀疏嵌入被索引并常驻内存用于粗粒度候选搜索,而重量级稠密嵌入存放于磁盘用于细粒度后置验证。为获得最佳检索精度,设计了一种渐进优化框架。稀疏嵌入先行学习,以实现高质量候选搜索;以稀疏嵌入诱导出的候选分布为条件,持续学习稠密嵌入以优化正样本与入围候选的区分度。此外,引入对比量化与局部性中心采样两种技术用于稀疏与稠密嵌入的学习,显著提升了各自性能。得益于上述特性,我们的方法有效处理海量规模 EBR,并在精度上具备强劲优势:在百万级语料上召回率提升达 +4.3%,在十亿级语料上召回率提升达 +17.5%。此外,我们的方法应用于某主流赞助搜索平台,在收入(+1.95%)、召回率(+1.01%)与点击率(+0.49%)上均取得显著提升。代码见 https://github.com/microsoft/BiDR。

关键词

引用

@article{arxiv.2201.05409,
  title  = {Progressively Optimized Bi-Granular Document Representation for Scalable Embedding Based Retrieval},
  author = {Shitao Xiao and Zheng Liu and Weihao Han and Jianjin Zhang and Yingxia Shao and Defu Lian and Chaozhuo Li and Hao Sun and Denvy Deng and Liangjie Zhang and Qi Zhang and Xing Xie},
  journal= {arXiv preprint arXiv:2201.05409},
  year   = {2022}
}

备注

Accepted as a full paper in WWW 2022