中文

基于强化学习的多任务融合用于推荐系统长期用户满意度

信息检索 2022-08-11 v2 人工智能

摘要

推荐系统 (Recommender System, RS) 是每日影响数十亿用户的重要在线应用。主流 RS 排序框架由两部分组成:预测各类用户反馈(即点击、点赞、分享)的多任务学习模型 (Multi-Task Learning, MTL),以及将多任务输出结合为关于用户满意度的单一最终排序分数的多任务融合模型 (Multi-Task Fusion, MTF)。尽管 MTL 作为排序的最后关键环节对最终推荐影响重大,针对融合模型的研究却不多。为优化长期用户满意度而非贪婪获取即时回报,我们将 MTF 任务建模为推荐会话内的马尔可夫决策过程 (Markov Decision Process, MDP),并提出一种基于批量强化学习 (Batch Reinforcement Learning, RL) 的多任务融合框架 (BatchRL-MTF),包含批量 RL 框架与在线探索。前者利用批量 RL 从固定批量数据离线学习最优推荐策略以达成长期用户满意度,后者在线探索潜在高价值动作以突破局部最优困境。通过对用户行为的全面调研,我们从用户粘性与用户活跃度两方面以精细启发式方法建模用户满意度奖励。最后,我们在十亿样本级真实数据集上开展广泛实验以证明模型有效性。我们提出一种保守离线策略估计器 (Conservative-OPEstimator) 用于离线测试模型。此外,我们在真实推荐环境中进行在线实验比较不同模型性能。作为少数成功应用于 MTF 任务的批量 RL 研究之一,我们的模型也已部署于大型工业级短视频平台,服务数亿用户。

关键词

引用

@article{arxiv.2208.04560,
  title  = {Multi-Task Fusion via Reinforcement Learning for Long-Term User Satisfaction in Recommender Systems},
  author = {Qihua Zhang and Junning Liu and Yuzhuo Dai and Yiyan Qi and Yifan Yuan and Kunlun Zheng and Fan Huang and Xianfeng Tan},
  journal= {arXiv preprint arXiv:2208.04560},
  year   = {2022}
}

备注

This paper has been accepted by SIGKDD 2022