用离去老虎机对推荐系统中的用户流失建模
机器学习
2024-02-19 v2 信息检索
机器学习
摘要
传统上,当推荐系统被形式化为多臂老虎机时,推荐系统的策略会影响所累积的奖励,但不会影响交互的时长。然而,在现实系统中,不满意的用户可能会离开(且不再回来)。在这项工作中,我们提出了一种新颖的多臂老虎机设置,以捕捉这种依赖于策略的交互时长。我们的设置包含一个有限的用户类型集合,以及多个具有伯努利收益的臂。每个(用户类型,臂)元组对应一个(未知的)奖励概率。每个用户的类型最初是未知的,只能通过他们对推荐的响应来推断。此外,如果用户对其推荐不满意,他们可能会离开系统。我们首先处理所有用户共享同一类型的情况,证明一种近期基于UCB的算法是最优的。然后,我们转向更具挑战性的情况,即用户分为两种类型。虽然朴素方法无法处理此设置,但我们提供了一种高效的学习算法,其遗憾值达到 ,其中 是用户数量。
引用
@article{arxiv.2203.13423,
title = {Modeling Attrition in Recommender Systems with Departing Bandits},
author = {Omer Ben-Porat and Lee Cohen and Liu Leqi and Zachary C. Lipton and Yishay Mansour},
journal= {arXiv preprint arXiv:2203.13423},
year = {2024}
}
备注
Accepted at AAAI 2022