利用短视界强化学习改进推荐系统中的长期指标
机器学习
2021-09-16 v2
摘要
我们研究了基于会话的推荐场景,其中我们希望在顺序交互过程中向用户推荐物品,以提升其长期效用。优化长期指标具有挑战性,因为学习信号(即推荐是否达成了预期目标)是延迟的,并且受到用户与系统的其他交互的混淆。以点击等可立即度量的代理指标为目标,可能因与长期指标不一致而导致次优推荐。我们提出了一种称为短视界策略改进(SHPI)的新强化学习算法,该算法近似跨会话的用户行为策略诱导漂移。SHPI 是对用于基于会话推荐的情景式 RL 算法的直接修改,此外还在每个会话中给出适当的终止奖励。在四个推荐任务上的实证结果表明,SHPI 能够优于使用离线代理信号的矩阵分解、具有短视在线代理的 bandit 以及用户交互量有限的 RL 基线等最先进的推荐技术。
引用
@article{arxiv.2106.00589,
title = {Improving Long-Term Metrics in Recommendation Systems using Short-Horizon Reinforcement Learning},
author = {Bogdan Mazoure and Paul Mineiro and Pavithra Srinath and Reza Sharifi Sedeh and Doina Precup and Adith Swaminathan},
journal= {arXiv preprint arXiv:2106.00589},
year = {2021}
}