中文

Sim2Rec:一种基于模拟器的决策方法以优化序列推荐系统中的真实世界长期用户参与度

信息检索 2023-05-09 v1 机器学习

摘要

序列推荐系统(SRS)中的长期用户参与度(LTE)优化已被证明适合采用强化学习(RL),其可寻找最大化长期奖励的策略。同时,RL存在其缺陷,特别是需要大量在线样本进行探索,这在真实世界应用中具有风险。避免该风险的一种有吸引力的方法是构建模拟器并在其中学习最优推荐策略。在LTE优化中,模拟器针对给定推荐模拟多个用户的每日反馈。然而,构建无现实差距(即能精确预测用户反馈)的用户模拟器是不现实的,因为用户的反应模式复杂且每个用户的历史日志有限,这可能误导基于模拟器的推荐策略。本文提出一种实用的基于模拟器的推荐策略训练方法——Simulation-to-Recommendation(Sim2Rec),以处理LTE优化中的现实差距问题。具体而言,Sim2Rec引入一组模拟器生成用户行为模式的多种可能性,然后训练一个环境参数提取器来识别模拟器中用户的行为模式。最后,训练一个上下文感知策略,基于推断的环境参数对所有变体用户做出最优决策。该策略可直接迁移至未见过环境(如真实世界),因为它已学会识别各种用户行为模式并基于推断的环境参数做出正确决策。实验在合成环境及真实世界大规模网约车平台滴滴出行上进行。结果表明,Sim2Rec取得了显著的性能提升,并在未见过环境中产生鲁棒推荐。

关键词

引用

@article{arxiv.2305.04832,
  title  = {Sim2Rec: A Simulator-based Decision-making Approach to Optimize Real-World Long-term User Engagement in Sequential Recommender Systems},
  author = {Xiong-Hui Chen and Bowei He and Yang Yu and Qingyang Li and Zhiwei Qin and Wenjie Shang and Jieping Ye and Chen Ma},
  journal= {arXiv preprint arXiv:2305.04832},
  year   = {2023}
}