中文

面向基于 slate 的推荐系统的强化学习:一种可处理的分解与实用方法

机器学习 2019-06-03 v2 人工智能 信息检索 机器学习

摘要

大多数实用的推荐系统侧重于估计即时用户参与度,而未考虑推荐对用户行为的长期影响。强化学习(RL)方法具有优化长期用户参与度的潜力。然而,由于用户通常面对的是包含多个条目的 slate——这些条目可能对用户选择产生交互影响——因此需要能够处理 RL 动作空间组合爆炸的方法。在这项工作中,我们应对使用 RL 进行基于 slate 的推荐以优化长期价值的挑战。我们的贡献有三方面。(i)我们开发了 SLATEQ,一种基于价值的时间差分和 Q-learning 的分解,使 RL 在 slate 下可处理。在关于用户选择行为的温和假设下,我们证明了一个 slate 的长期价值(LTV)可分解为其组成条目级 LTV 的可处理函数。(ii)我们概述了一种利用现有基于近视学习的推荐器来快速开发处理 LTV 的推荐器的方法论。(iii)我们在仿真中演示了我们的方法,并在 YouTube 的在线实验中验证了使用 SLATEQ 的分解 TD-learning 的可扩展性。

关键词

引用

@article{arxiv.1905.12767,
  title  = {Reinforcement Learning for Slate-based Recommender Systems: A Tractable Decomposition and Practical Methodology},
  author = {Eugene Ie and Vihan Jain and Jing Wang and Sanmit Narvekar and Ritesh Agarwal and Rui Wu and Heng-Tze Cheng and Morgane Lustman and Vince Gatto and Paul Covington and Jim McFadden and Tushar Chandra and Craig Boutilier},
  journal= {arXiv preprint arXiv:1905.12767},
  year   = {2019}
}

备注

Short version to appear IJCAI-2019