中文

面向推荐系统的监督优势 actor-critic

机器学习 2021-11-08 v1 信息检索

摘要

将会话式或序列推荐通过奖励信号建模为强化学习(RL)是迈向最大化累积收益的推荐系统(RS)的一个有前景的研究方向。然而,由于离策略训练、巨大动作空间以及缺乏充足奖励信号等挑战,在RS设定中直接使用RL算法并不现实。近期针对RS的RL方法试图通过结合RL与(自)监督序列学习来应对这些挑战,但仍存在某些局限。例如,由于缺乏负奖励信号,Q值估计往往偏向正值;此外,Q值也严重依赖于序列的特定时间戳。为解决上述问题,我们提出用于训练RL组件的负采样策略,并将其与监督序列学习相结合,称此方法为监督负Q学习(SNQN)。基于采样得到的(负)动作(物品),我们可以计算正动作相对于平均情形的“优势”,并进一步将其用作学习监督序列部分的归一化权重。这引出了另一学习框架:监督优势Actor-Critic(SA2C)。我们使用四种最先进的序列推荐模型实例化SNQN与SA2C,并在两个真实世界数据集上开展实验。实验结果表明,所提方法显著优于最先进的监督方法与现有的自监督RL方法。代码将开源。

关键词

引用

@article{arxiv.2111.03474,
  title  = {Supervised Advantage Actor-Critic for Recommender Systems},
  author = {Xin Xin and Alexandros Karatzoglou and Ioannis Arapakis and Joemon M. Jose},
  journal= {arXiv preprint arXiv:2111.03474},
  year   = {2021}
}

备注

9 pages, 4 figures, In Proceedings of the 15th ACM International Conference on Web Search and Data Mining (WSDM '22), February 21-25, 2022, Phoenix, Arizona. arXiv admin note: text overlap with arXiv:2006.05779