中文

UOEP:面向用户的探索策略,用于提升推荐系统的长期用户体验

信息检索 2024-05-24 v2 人工智能

摘要

强化学习(RL)因能有效探索用户兴趣,在提升推荐系统长期用户体验方面日益受到关注。然而,现代推荐系统在数千万物品中呈现出差异化的用户行为模式,这增加了探索的难度。例如,不同活跃度的用户行为需要不同强度的探索,而以往研究常忽略这一点,对所有用户采用统一的探索策略,最终损害了长期用户体验。为应对这些挑战,我们提出了面向用户的探索策略(UOEP),这是一种促进用户群体间细粒度探索的新方法。我们首先构建了一个分布式评论家,允许在用户累积奖励反馈的不同分位数水平下进行策略优化,这些分位数水平代表了不同活跃度的用户群体。在该评论家的引导下,我们设计了一组不同的行动者,旨在各自对应的用户群体内进行有效且细粒度的探索。为了在探索过程中同时增强多样性和稳定性,我们进一步引入了群体级多样性正则化项和监督模块。在公开推荐数据集上的实验结果表明,我们的方法在长期性能上优于所有基线,验证了其面向用户的探索有效性。同时,进一步的分析揭示了我们的方法在提升低活跃度用户性能以及增加用户间公平性方面的益处。

关键词

引用

@article{arxiv.2401.09034,
  title  = {UOEP: User-Oriented Exploration Policy for Enhancing Long-Term User Experiences in Recommender Systems},
  author = {Changshuo Zhang and Sirui Chen and Xiao Zhang and Sunhao Dai and Weijie Yu and Jun Xu},
  journal= {arXiv preprint arXiv:2401.09034},
  year   = {2024}
}