语义化商品搜索
信息检索
2019-07-02 v1 计算与语言
摘要
我们研究商品搜索中的语义匹配问题,即给定客户查询,从目录中检索所有语义相关的商品。通过倒排索引的纯词法匹配在这方面存在不足,原因有几点:a) 缺乏对上位词、同义词和反义词的理解,b) 对形态变体(例如“woman”与“women”)的脆弱性,以及 c) 对拼写错误的敏感性。为解决这些问题,我们利用客户行为数据训练了一个用于语义匹配的深度学习模型。近期许多使用深度学习的大规模语义搜索工作聚焦于网页搜索的排序。相比之下,商品搜索的语义匹配提出了若干新颖挑战,我们在本文中予以阐明。我们通过以下方式应对这些挑战:a) 开发一种具有内置阈值的新损失函数,以区分随机负例、曝光但未购买例和正例(购买项),b) 将平均池化与 n-gram 结合以捕获短程语言模式,c) 使用哈希处理词汇表外词元,以及 d) 使用模型并行训练架构在 8 个 GPU 上扩展。我们给出了令人信服的离线结果,表明在相同分词方法下,相对于基线最先进语义搜索方法,Recall@100 至少提升 4.7%,平均精度均值(MAP)提升 14.5%。此外,我们给出了在线 A/B 测试的结果并讨论了经验,证明了我们方法的有效性。
引用
@article{arxiv.1907.00937,
title = {Semantic Product Search},
author = {Priyanka Nigam and Yiwei Song and Vijai Mohan and Vihan Lakshman and Weitian and Ding and Ankit Shingavi and Choon Hui Teo and Hao Gu and Bing Yin},
journal= {arXiv preprint arXiv:1907.00937},
year = {2019}
}
备注
10 pages, 7 figures, KDD 2019 (Applied Data Science Track)