中文

利用短视界强化学习改进推荐系统中的长期指标

机器学习 2021-09-16 v2

摘要

我们研究了基于会话的推荐场景,其中我们希望在顺序交互过程中向用户推荐物品,以提升其长期效用。优化长期指标具有挑战性,因为学习信号(即推荐是否达成了预期目标)是延迟的,并且受到用户与系统的其他交互的混淆。以点击等可立即度量的代理指标为目标,可能因与长期指标不一致而导致次优推荐。我们提出了一种称为短视界策略改进(SHPI)的新强化学习算法,该算法近似跨会话的用户行为策略诱导漂移。SHPI 是对用于基于会话推荐的情景式 RL 算法的直接修改,此外还在每个会话中给出适当的终止奖励。在四个推荐任务上的实证结果表明,SHPI 能够优于使用离线代理信号的矩阵分解、具有短视在线代理的 bandit 以及用户交互量有限的 RL 基线等最先进的推荐技术。

关键词

引用

@article{arxiv.2106.00589,
  title  = {Improving Long-Term Metrics in Recommendation Systems using Short-Horizon Reinforcement Learning},
  author = {Bogdan Mazoure and Paul Mineiro and Pavithra Srinath and Reza Sharifi Sedeh and Doina Precup and Adith Swaminathan},
  journal= {arXiv preprint arXiv:2106.00589},
  year   = {2021}
}