中文

基于强化学习推荐系统的对比状态增强

信息检索 2023-05-19 v1

摘要

从历史的用户-物品交互序列中学习基于强化学习(RL)的推荐系统,对于生成高奖励推荐并改善长期累积收益至关重要。然而,现有的RL推荐方法面临困难:(i)难以估计离线训练数据中未包含状态的价值函数;(ii)由于缺乏对比信号,难以从用户隐式反馈中学习有效的状态表示。在这项工作中,我们提出对比状态增强(CSA)用于基于RL的推荐系统的训练。针对第一个问题,我们提出四种状态增强策略以扩大离线数据的状态空间。所提方法通过使RL智能体访问局部状态区域并确保原始状态与增强状态之间学习的价值函数相似,提升了推荐系统的泛化能力。针对第二个问题,我们提出在增强状态与从其他会话随机采样的状态之间引入对比信号,以进一步改进状态表示学习。为验证所提CSA的有效性,我们在两个公开数据集和一个来自真实电商平台的收集数据集上进行了大量实验。我们还在模拟环境中作为在线评估设置进行了实验。实验结果表明CSA能有效提升推荐性能。

关键词

引用

@article{arxiv.2305.11081,
  title  = {Contrastive State Augmentations for Reinforcement Learning-Based Recommender Systems},
  author = {Zhaochun Ren and Na Huang and Yidan Wang and Pengjie Ren and Jun Ma and Jiahuan Lei and Xinlei Shi and Hengliang Luo and Joemon M Jose and Xin Xin},
  journal= {arXiv preprint arXiv:2305.11081},
  year   = {2023}
}