产品搜索中监督式学习匹配方法的比较
信息检索
2020-07-21 v1
摘要
词汇鸿沟是信息检索(IR)中的核心挑战。在诸如产品搜索等电子商务应用中,据报道词汇鸿沟比在新闻搜索或网页搜索等更传统的 IR 应用领域更具挑战性。由于近期学习匹配方法已在弥合这些传统 IR 领域的词汇鸿沟方面取得重要进展,我们研究了其在产品搜索背景下的潜力。本文提供了将近期学习匹配方法用于产品搜索的见解。我们在产品搜索设定下比较了这些方法的有效性与效率,并在两个各含 50,000 条查询的产品搜索数据集上分析了其性能。其中一个是作为 CIKM 2016 社区基准活动一部分发布的开放数据集。另一个是从某欧洲电子商务平台获取的专有查询日志。该比较旨在更好地理解为此任务选择偏好模型时的权衡。我们发现:(1) 专为短文本匹配设计的模型,如 MV-LSTM 与 DRMMTKS,在所有实验中始终位列前三;然而同时考虑效率与准确率时,ARC-I 是真实世界用例的首选模型;且 (2) 最先进的基于 BERT 的模型性能平庸,我们将其归因于 BERT 预训练所用的文本与产品搜索中我们的文本差异很大。我们还提供了对可影响不同查询类型下模型行为的因素(如检索列表长度与查询复杂度)的见解,并讨论了我们的发现对电子商务从业者在选择表现良好方法方面的启示。
引用
@article{arxiv.2007.10296,
title = {A Comparison of Supervised Learning to Match Methods for Product Search},
author = {Fatemeh Sarvi and Nikos Voskarides and Lois Mooiman and Sebastian Schelter and Maarten de Rijke},
journal= {arXiv preprint arXiv:2007.10296},
year = {2020}
}
备注
10 pages, 5 figures, Accepted at SIGIR Workshop on eCommerce 2020