中文

UNEX-RL:在具有单向执行的多阶段推荐系统中强化长期奖励

信息检索 2024-01-15 v1

摘要

近年来,利用强化学习(RL)优化推荐系统中的长期奖励引起了越来越多的兴趣。由于工业推荐系统通常设计为多阶段系统,单智能体RL方法在同时优化多个阶段时面临挑战。原因是不同阶段具有不同的观测空间,因此无法由单个智能体建模。为解决此问题,我们提出了一种新颖的基于单向执行的多智能体强化学习(UNEX-RL)框架,以强化多阶段推荐系统中的长期奖励。我们表明,单向执行是多阶段推荐系统的一个关键特征,给多智能体强化学习(MARL)的应用带来了新的挑战,即观测依赖性和级联效应。为应对这些挑战,我们提供了一种级联信息链(CIC)方法,将独立观测与动作依赖观测分离,并使用CIC有效训练UNEX-RL。我们还讨论了UNEX-RL的实际方差缩减技术。最后,我们在公共数据集和一个拥有超过1亿用户的在线推荐系统上展示了UNEX-RL的有效性。具体而言,在在线A/B实验中,与单智能体RL算法相比,UNEX-RL在用户使用时长上提升了0.558%,突显了UNEX-RL在工业推荐系统中的有效性。

关键词

引用

@article{arxiv.2401.06470,
  title  = {UNEX-RL: Reinforcing Long-Term Rewards in Multi-Stage Recommender Systems with UNidirectional EXecution},
  author = {Gengrui Zhang and Yao Wang and Xiaoshuang Chen and Hongyi Qian and Kaiqiao Zhan and Ben Wang},
  journal= {arXiv preprint arXiv:2401.06470},
  year   = {2024}
}

备注

Accepted by AAAI2024