面向生产化的主观搜索系统
数据库
2020-04-01 v1 信息检索
摘要
现有的电子商务搜索引擎通常仅支持对客观属性(如价格和地点)的搜索,而将更受青睐的主观属性(如浪漫氛围和工作生活平衡)排除在可搜索范围之外。我们发现 Recruit Group 也存在这种情况,该集团运营着广泛的在线预订与搜索服务,包括招聘、旅游、住房、婚庆、餐饮、美容等,其中每项服务即便在国际上不是最大,也在日本位居前列。我们展示了将 Megagon Labs 为 Recruit Group 开发的近期主观搜索原型(OpineDB)推向生产化的进展。OpineDB 中的若干组件得到了增强以满足生产需求,包括添加了在大规模酒店领域评论语料上预训练的 BERT 语言模型。我们还发现,系统生产化面临的挑战超出了增强组件本身。特别地,生产质量系统的一项重要要求是建立恰当的搜索质量度量方式,而当搜索结果为主观内容时这一点极为棘手。这促使我们从零创建了一套高质量基准数据集,通过用户访谈涉及超过 600 条查询,并收集了超过 120,000 条查询-实体相关性标注。此外,我们发现现有搜索算法未达到生产系统所需的搜索质量标准。因此,我们在学习排序(learning-to-rank)框架下通过微调若干搜索算法并将其组合来增强排序模型。该模型在整体精度上实现了 5%–10% 的提升,且在超过一半的基准测试查询上达到了 90% 以上的精度,使这些查询可用于 AB 测试。尽管某些增强可立即应用于其他垂直领域,但我们的经验表明,基准构建与排序算法微调因领域而异且无法回避。
引用
@article{arxiv.2003.13968,
title = {Towards Productionizing Subjective Search Systems},
author = {Aaron Feng and Shuwei Chen and Yuliang Li and Hiroshi Matsuda and Hidekazu Tamaki and Wang-Chiew Tan},
journal= {arXiv preprint arXiv:2003.13968},
year = {2020}
}
备注
In Submission to VLDB 2020