从权重中学习:一种用于广告检索的成本敏感方法
信息检索
2018-12-04 v2 机器学习
摘要
诸如CLSM之类的检索模型在点击率数据上训练,将每个被点击的查询-文档对视为等价。虽然在点击率数据上训练是合理的,本文认为由于其噪声与长尾特性(尤其对于赞助搜索),这是次优的。本文中,我们讨论了在训练集中纳入或忽略长尾对的影响。此外,我们提出了一种基于加权的策略,借此我们可以在不损害检索质量的前提下学习长尾对的语义表示。我们在Bing赞助搜索以及Amazon产品推荐上进行了实验,以证明该方法具有领域无关性。在线上搜索引擎流量的A/B测试显示,与未加权模型相比,点击量(CTR提高11.8%)与质量(跳出率降低8.2%)均有所改善。我们还在Amazon产品推荐数据上进行了实验,在协同购买产品间检索计算的NDCG分数有轻微提升。
引用
@article{arxiv.1811.12776,
title = {Learning From Weights: A Cost-Sensitive Approach For Ad Retrieval},
author = {Nikit Begwani and Shrutendra Harsola and Rahul Agrawal},
journal= {arXiv preprint arXiv:1811.12776},
year = {2018}
}
备注
7 pages, 5 figures, DAPA, WSDM Workshop