中文

相似建模中概率身份数据的离屏评估

机器学习 2019-03-27 v1 机器学习

摘要

我们在相似定向广告活动的背景下,评估了约2017年9月至12月收集的概率构造数字身份数据的影响。本研究的主干是一大批概率构造的“身份”,表示为带有相关元数据的小袋cookie和移动广告标识符,它们很可能全部由同一底层用户拥有。该身份数据允许生成“基于身份”而非“基于标识符”的用户模型,从而更全面地刻画标识符背后用户的兴趣。我们采用离屏技术评估身份赋能的相似模型的潜力,而无需承担让未测试模型引导大量广告支出或进行A/B测试巨大成本的风险。我们通过指出一种显著的“有限样本偏差”类型,补充了关于离屏评估的历史工作,该偏差出现在结合中等规模数据集与涉及稀有事件(如转化)的评估指标的研究中。我们通过一项仿真研究说明了该偏差,该研究随后指导了我们对真实数据分析中逆倾向得分权重的处理。我们展示了身份赋能的相似模型相对于忽略身份的基线有显著提升:平均转化率提升约70%。对于自身数据很少但可推断属于拥有大量可跨标识符聚合数据的用户的标识符,该提升达到约(4-32)倍。这意味着身份赋能的用户建模在标识符寿命极短(即频繁更换的cookie)的情况下尤为重要。我们的工作推动并指导了概率构造身份在营销中的使用,也深化了采用离屏学习评估互联网经济复杂系统的示例库。

关键词

引用

@article{arxiv.1901.05560,
  title  = {Off-Policy Evaluation of Probabilistic Identity Data in Lookalike Modeling},
  author = {Randell Cotta and Mingyang Hu and Dan Jiang and Peizhou Liao},
  journal= {arXiv preprint arXiv:1901.05560},
  year   = {2019}
}

备注

Accepted by WSDM 2019