中文

全链路推荐

信息检索 2020-08-18 v3

摘要

随着近年来强化学习(RL)的流行,基于 RL 的推荐系统研发引起了巨大关注。在实际推荐会话中,用户会顺序访问多个场景,例如入口页面与商品详情页,且每个场景有其特定特征。然而,现有多数基于 RL 的推荐系统侧重于为所有场景优化单一策略或分别优化各策略,这可能导致整体次优性能。本文研究具有多个(连续)场景的推荐问题,即全链路推荐。我们提出一种基于多智能体 RL 的方法(DeepChain),可捕捉不同场景间的序列相关性并联合优化多个推荐策略。具体而言,所有推荐智能体(RAs)共享用户历史行为的同一记忆,并协同工作以最大化一个会话的总体奖励。需注意,联合优化多个推荐策略在现有无模型 RL 模型中面临两个挑战——(i) 需要海量用户行为数据,以及 (ii) 奖励(用户反馈)分布极度不平衡。本文引入基于模型的 RL 技术以降低训练数据需求并执行更精确的策略更新。基于真实电商平台的实验结果证明了所提框架的有效性。

关键词

引用

@article{arxiv.1902.03987,
  title  = {Whole-Chain Recommendations},
  author = {Xiangyu Zhao and Long Xia and Linxin Zou and Hui Liu and Dawei Yin and Jiliang Tang},
  journal= {arXiv preprint arXiv:1902.03987},
  year   = {2020}
}

备注

29th ACM International Conference on Information and Knowledge Management