面向大规模在线移动推荐的场景化用户浏览_bandit 方法
机器学习
2020-08-24 v1 信息检索
摘要
在线推荐服务向用户推荐多种商品。如今,相当比例的用户通过移动设备访问电商平台。由于移动设备屏幕尺寸有限,物品的位置对点击有显著影响:1)位置越靠前,某商品点击越多。2)“伪曝光”问题:首屏仅展示少量推荐物品,用户需滑动屏幕浏览其他物品。因此,一些排在后面的推荐物品未被用户看到,将此类物品视为负样本并不恰当。尽管许多工作将在线推荐建模为上下文_bandit 问题,它们很少考虑位置的影响,从而奖励函数的估计可能有偏。本文旨在解决这两个问题以提升在线移动推荐性能。我们的贡献有四点。第一,由于我们关注一组推荐物品的奖励,我们将在线推荐建模为上下文组合_bandit 问题并定义推荐集的奖励。第二,我们提出一种称为 UBM-LinUCB 的新颖上下文组合_bandit 方法,通过采用用于网页搜索的点击模型 User Browsing Model (UBM) 来解决与位置相关的两个问题。第三,我们给出形式化的后悔分析,并证明我们的算法达到与物品数量无关的次线性后悔。最后,我们通过一种新颖的无偏估计器在两个真实世界数据集上评估算法。在线实验也在全球最受欢迎的电商平台之一淘宝上实施。两个 CTR 指标上的结果表明我们的算法优于其他上下文_bandit 算法。
引用
@article{arxiv.2008.09368,
title = {Contextual User Browsing Bandits for Large-Scale Online Mobile Recommendation},
author = {Xu He and Bo An and Yanghua Li and Haikai Chen and Qingyu Guo and Xin Li and Zhirong Wang},
journal= {arXiv preprint arXiv:2008.09368},
year = {2020}
}