中文

面向生命周期价值推荐系统的自动表示

机器学习 2017-02-24 v1 机器学习

摘要

许多现代商业网站采用推荐系统向用户推送相关内容。尽管多数系统侧重于最大化即时收益(点击、购买或评分),但更优的成功度量应是用户与系统交互的生命周期价值(LTV)。LTV方法考虑物品推荐的长期影响,并寻求随时间累积收益的最大化。强化学习(RL)框架是优化长期累积收益的标准表述。然而,由于RL相关的表示、优化与验证技术可能较为复杂,实践中很少使用。本文提出一种将RL与推荐系统结合的新架构,其免除了手工调参特征的需求,从而实现了状态空间表示构建过程的自动化。我们分析了该表述中的实际困难,并在批量离线真实推荐数据上测试了我们的解决方案。

关键词

引用

@article{arxiv.1702.07125,
  title  = {Automatic Representation for Lifetime Value Recommender Systems},
  author = {Assaf Hallak and Yishay Mansour and Elad Yom-Tov},
  journal= {arXiv preprint arXiv:1702.07125},
  year   = {2017}
}