面向基于 slate 的推荐系统的强化学习:一种可处理的分解与实用方法
机器学习
2019-06-03 v2 人工智能
信息检索
机器学习
摘要
大多数实用的推荐系统侧重于估计即时用户参与度,而未考虑推荐对用户行为的长期影响。强化学习(RL)方法具有优化长期用户参与度的潜力。然而,由于用户通常面对的是包含多个条目的 slate——这些条目可能对用户选择产生交互影响——因此需要能够处理 RL 动作空间组合爆炸的方法。在这项工作中,我们应对使用 RL 进行基于 slate 的推荐以优化长期价值的挑战。我们的贡献有三方面。(i)我们开发了 SLATEQ,一种基于价值的时间差分和 Q-learning 的分解,使 RL 在 slate 下可处理。在关于用户选择行为的温和假设下,我们证明了一个 slate 的长期价值(LTV)可分解为其组成条目级 LTV 的可处理函数。(ii)我们概述了一种利用现有基于近视学习的推荐器来快速开发处理 LTV 的推荐器的方法论。(iii)我们在仿真中演示了我们的方法,并在 YouTube 的在线实验中验证了使用 SLATEQ 的分解 TD-learning 的可扩展性。
引用
@article{arxiv.1905.12767,
title = {Reinforcement Learning for Slate-based Recommender Systems: A Tractable Decomposition and Practical Methodology},
author = {Eugene Ie and Vihan Jain and Jing Wang and Sanmit Narvekar and Ritesh Agarwal and Rui Wu and Heng-Tze Cheng and Morgane Lustman and Vince Gatto and Paul Covington and Jim McFadden and Tushar Chandra and Craig Boutilier},
journal= {arXiv preprint arXiv:1905.12767},
year = {2019}
}
备注
Short version to appear IJCAI-2019