中文

基于强化学习优化推荐系统中的长期用户参与度

信息检索 2019-07-12 v4

摘要

推荐系统在我们的日常生活中起着至关重要的作用。信息流机制已在推荐系统中被广泛使用,尤其是在移动应用中。信息流设置以永无止境的信息流为用户提供交互式推荐方式。在这种交互方式下,一个好的推荐系统应更加关注用户粘性,这远远超出经典的即时指标,通常以来衡量长期用户参与度。直接优化长期用户参与度是一个非平凡的问题,因为学习目标通常无法用于传统的监督学习方法。尽管强化学习(RL)天然适合最大化长期奖励的问题,但将RL应用于优化长期用户参与度仍面临挑战:用户行为多样且难以建模,通常包含即时反馈(如点击、下单)和延迟反馈(如停留时间、回访);此外,有效的离策略学习仍不成熟,尤其是在结合自举与函数近似时。为解决这些问题,本文引入一种强化学习框架——FeedRec来优化长期用户参与度。FeedRec包含两个组件:1)一个设计为分层LSTM的Q网络,负责建模复杂用户行为;2)一个S网络,用于模拟环境、辅助Q网络并避免策略学习中收敛的不稳定性。在合成数据和真实世界大规模数据上的大量实验表明,FeedRec有效优化了长期用户参与度,并优于当前最优方法。

关键词

引用

@article{arxiv.1902.05570,
  title  = {Reinforcement Learning to Optimize Long-term User Engagement in Recommender Systems},
  author = {Lixin Zou and Long Xia and Zhuoye Ding and Jiaxing Song and Weidong Liu and Dawei Yin},
  journal= {arXiv preprint arXiv:1902.05570},
  year   = {2019}
}