中文

拥抱数据结构以实现十亿规模语义商品搜索

信息检索 2021-10-13 v1 机器学习

摘要

我们提出在十亿规模上训练与部署二部神经嵌入模型的系统性方法,并将研究重点置于语义商品搜索的应用。训练二部模型时,旨在将两类不同实体(如查询与文档,或用户与电影)嵌入同一向量空间,使高相关性配对彼此邻近。推理时,给定一类实体的嵌入(如查询或用户),需检索另一类高度相关的实体(分别为文档或电影)。本工作中,我们展示利用真实世界数据集的自然结构可高效应对上述两重挑战。具体而言,我们将二部数据建模为二部图,在正关联配对间连边。进而提出将该网络划分为语义一致的簇,从而通过针对给定输入聚焦少量分区来缩减搜索空间。训练期间,该技术使我们能高效挖掘困难负例;推理时,可快速找到给定嵌入的最近邻。我们提供的离线实验结果证明了所述技术在十亿规模 Amazon.com 商品搜索数据集上训练与推理的有效性。

关键词

引用

@article{arxiv.2110.06125,
  title  = {Embracing Structure in Data for Billion-Scale Semantic Product Search},
  author = {Vihan Lakshman and Choon Hui Teo and Xiaowen Chu and Priyanka Nigam and Abhinandan Patni and Pooja Maknikar and SVN Vishwanathan},
  journal= {arXiv preprint arXiv:2110.06125},
  year   = {2021}
}

备注

10 pages