中文

用离去老虎机对推荐系统中的用户流失建模

机器学习 2024-02-19 v2 信息检索 机器学习

摘要

传统上,当推荐系统被形式化为多臂老虎机时,推荐系统的策略会影响所累积的奖励,但不会影响交互的时长。然而,在现实系统中,不满意的用户可能会离开(且不再回来)。在这项工作中,我们提出了一种新颖的多臂老虎机设置,以捕捉这种依赖于策略的交互时长。我们的设置包含一个有限的用户类型集合,以及多个具有伯努利收益的臂。每个(用户类型,臂)元组对应一个(未知的)奖励概率。每个用户的类型最初是未知的,只能通过他们对推荐的响应来推断。此外,如果用户对其推荐不满意,他们可能会离开系统。我们首先处理所有用户共享同一类型的情况,证明一种近期基于UCB的算法是最优的。然后,我们转向更具挑战性的情况,即用户分为两种类型。虽然朴素方法无法处理此设置,但我们提供了一种高效的学习算法,其遗憾值达到 O~(T)\tilde{O}(\sqrt{T}),其中 TT 是用户数量。

关键词

引用

@article{arxiv.2203.13423,
  title  = {Modeling Attrition in Recommender Systems with Departing Bandits},
  author = {Omer Ben-Porat and Lee Cohen and Liu Leqi and Zachary C. Lipton and Yishay Mansour},
  journal= {arXiv preprint arXiv:2203.13423},
  year   = {2024}
}

备注

Accepted at AAAI 2022