中文

AURO:面向推荐系统自适应用户留存优化的强化学习

信息检索 2025-02-27 v3 机器学习

摘要

强化学习(RL)因其优化推荐系统中用户留存的能力而受到越来越多的关注。该优化过程中的一个主要障碍是环境非平稳性,其源于用户行为模式随时间的持续而复杂的演变,例如交互率和留存倾向的变化。这些变化对现有的推荐 RL 算法提出了重大挑战,导致动态性和奖励分布偏移问题。本文提出一种称为自适应用户留存优化(AURO)的新方法来应对这一挑战。为在非平稳环境中引导推荐策略,AURO 在策略网络中引入了一个状态抽象模块。该模块使用一种新的基于价值的损失函数进行训练,使其输出与当前策略的估计性能对齐。由于 RL 的策略性能对环境漂移敏感,该损失函数使状态抽象能够反映环境变化并通知推荐策略相应调整。此外,环境的非平稳性引入了隐式冷启动问题,即推荐策略持续与表现出新颖行为模式的用户交互。AURO 鼓励在基于性能的拒绝采样保护下进行探索,以在成本敏感的在线环境中维持稳定的推荐质量。我们在用户留存模拟器、MovieLens 数据集和一个实时短视频推荐平台上进行了广泛的实证分析,证明了 AURO 相对于所有评估的基线算法的优越性能。

关键词

引用

@article{arxiv.2310.03984,
  title  = {AURO: Reinforcement Learning for Adaptive User Retention Optimization in Recommender Systems},
  author = {Zhenghai Xue and Qingpeng Cai and Bin Yang and Lantao Hu and Peng Jiang and Kun Gai and Bo An},
  journal= {arXiv preprint arXiv:2310.03984},
  year   = {2025}
}

备注

The Web Conference 2025 (Oral)