以数据增强方式检索赞助搜索中高频查询的同义关键词
信息检索
2020-08-06 v1
摘要
在赞助搜索中,检索同义关键词对于精准定向广告至关重要。查询与关键词之间的语义鸿沟以及极高的精度要求(>= 95%)是该任务的两大主要挑战。据我们所知,该问题尚未被公开讨论。在工业界赞助搜索系统中,高频查询的检索关键词通常提前完成并存储于查找表中。将这些结果视为种子数据集,我们提出一种类数据增强框架以提升这些高频查询的同义检索性能。该框架包含两步:基于翻译的检索与基于判别的过滤。首先,我们设计一种基于 Trie 的翻译模型进行数据增量。在此阶段,采用了核心词袋(Bag-of-Core-Words)技巧,在保持原始精度的同时将 data increment 的规模提升了 4.2 倍。随后我们使用基于 BERT 的判别模型过滤非同义对,其绝对 AUC 较传统特征驱动的 GBDT 模型提升 11%。该方法已成功应用于百度的赞助搜索系统,显著提升了收益。此外,我们向公众发布了一个包含 50 万同义对、精度达 95% 的商业中文数据集用于释义研究(http://ai.baidu.com/broad/subordinate?dataset=paraphrasing)。
引用
@article{arxiv.2008.01969,
title = {Retrieve Synonymous keywords for Frequent Queries in Sponsored Search in a Data Augmentation Way},
author = {Yijiang Lian and Zhenjun You and Fan Wu and Wenqiang Liu and Jing Jia},
journal= {arXiv preprint arXiv:2008.01969},
year = {2020}
}