中文

以强化学习优化冷启动推荐中的生命周期价值

信息检索 2021-08-23 v1 人工智能 机器学习

摘要

推荐系统在现代电子商务平台中起着关键作用。由于用户与物品之间缺乏历史交互,冷启动推荐是一个具有挑战性的问题。为缓解冷启动问题,大多数现有方法引入内容和上下文信息作为辅助信息。然而,这些方法假设推荐物品随时间表现稳定,而在典型电商场景中,物品在其生命周期内的表现通常差异很大。在这种情况下,从物品角度考虑长期回报是有益的,而这是传统方法通常忽略的。强化学习(RL)天然契合此类长期优化问题,其中推荐者可以识别高潜力物品,主动分配更多用户曝光以促进其增长,从而提升多周期累积收益。受此启发,我们将该过程建模为部分可观测可控马尔可夫决策过程(POC-MDP),并提出一种 actor-critic RL 框架(RL-LTV),将物品生命周期价值(LTV)纳入推荐。在 RL-LTV 中,评论家研究物品的历史轨迹并预测新物品的未来 LTV,而行动者提出基于分数的策略以最大化未来 LTV 期望。行动者提出的分数随后在双排序框架中与经典排序分数结合,从而使推荐在 LTV 考量下保持平衡。我们的方法在一个最大的电子商务平台上,相对于强线上基线在冷启动物品的 IPV 和 GMV 上分别实现了 8.67% 和 18.03% 的相对提升。

关键词

引用

@article{arxiv.2108.09141,
  title  = {Reinforcement Learning to Optimize Lifetime Value in Cold-Start Recommendation},
  author = {Luo Ji and Qin Qi and Bingqing Han and Hongxia Yang},
  journal= {arXiv preprint arXiv:2108.09141},
  year   = {2021}
}

备注

Accepted by CIKM 2021