中文

使用多臂老虎机算法自适应优化电子商务中的内容推荐

信息检索 2021-08-23 v2 人工智能 机器学习

摘要

电子商务网站努力为用户提供最及时相关的信息,以减少购物摩擦并提高客户满意度。多臂老虎机模型(MAB)作为一种自适应优化算法,为此类目的提供了可能的方法。本文分析了使用三种经典MAB算法——epsilon-greedy、汤普森采样(TS)和上置信界1(UCB1)进行动态内容推荐,并详细介绍了在内部开发这些算法以解决实际电子商务用例的过程。首先,我们使用具有非平稳奖励分布的模拟购买数据集分析三种MAB算法,以模拟可能随时间变化的客户偏好,研究了不同算法的流量分配动态和累积奖励。其次,我们使用实际历史A/B测试数据集比较了三种MAB算法在超过1000次试验中的累积奖励。我们发现竞争推荐的成功率差异越大,MAB算法能获得的累积奖励越多。此外,我们发现TS在不同测试场景下显示出最高的平均累积奖励。第三,我们开发了一种批量更新的MAB算法,以克服电子商务中的延迟奖励问题,并在我们的App主页上实现了在线内容优化。为了进行最先进的比较,在我们的批量更新MAB算法、第三方MAB解决方案和默认业务逻辑之间进行了实际A/B测试。结果表明,与默认体验相比,我们的批量更新MAB算法实现了6.13%的相对点击率(CTR)提升和16.1%的相对转化率(CVR)提升;与外部MAB服务相比,实现了2.9%的相对CTR提升和1.4%的相对CVR提升。

关键词

引用

@article{arxiv.2108.01440,
  title  = {Adaptively Optimize Content Recommendation Using Multi Armed Bandit Algorithms in E-commerce},
  author = {Ding Xiang and Becky West and Jiaqi Wang and Xiquan Cui and Jinzhou Huang},
  journal= {arXiv preprint arXiv:2108.01440},
  year   = {2021}
}