中文

从权重中学习:一种用于广告检索的成本敏感方法

信息检索 2018-12-04 v2 机器学习

摘要

诸如CLSM之类的检索模型在点击率数据上训练,将每个被点击的查询-文档对视为等价。虽然在点击率数据上训练是合理的,本文认为由于其噪声与长尾特性(尤其对于赞助搜索),这是次优的。本文中,我们讨论了在训练集中纳入或忽略长尾对的影响。此外,我们提出了一种基于加权的策略,借此我们可以在不损害检索质量的前提下学习长尾对的语义表示。我们在Bing赞助搜索以及Amazon产品推荐上进行了实验,以证明该方法具有领域无关性。在线上搜索引擎流量的A/B测试显示,与未加权模型相比,点击量(CTR提高11.8%)与质量(跳出率降低8.2%)均有所改善。我们还在Amazon产品推荐数据上进行了实验,在协同购买产品间检索计算的NDCG分数有轻微提升。

关键词

引用

@article{arxiv.1811.12776,
  title  = {Learning From Weights: A Cost-Sensitive Approach For Ad Retrieval},
  author = {Nikit Begwani and Shrutendra Harsola and Rahul Agrawal},
  journal= {arXiv preprint arXiv:1811.12776},
  year   = {2018}
}

备注

7 pages, 5 figures, DAPA, WSDM Workshop