中文

基于强化学习并利用大语言模型进行状态奖励与动作建模的推荐系统

信息检索 2024-03-26 v1

摘要

基于强化学习(RL)的推荐系统通过从历史用户-物品交互中学习以做出准确的下一项推荐,在满足用户期望方面展现出了良好的性能。然而,现有的离线 RL 序列推荐方法面临着从环境中获取有效用户反馈的挑战。有效地对用户状态进行建模并为推荐塑造合适的奖励仍然是一个难题。在本文中,我们利用语言理解能力并将大语言模型(LLM)适配为环境(LE),以增强基于 RL 的推荐系统。该 LE 从部分用户-物品交互数据中学习,从而减少了对大量训练数据的需求,并且能够通过以下方式为离线数据合成用户反馈: 作为状态模型产生高质量状态以丰富用户表示; 作为奖励模型准确捕捉对动作的细微用户偏好。此外,LE 允许生成正向动作以扩充有限的离线训练数据。我们提出了一种 LE 增强方法,通过使用增强的动作和历史用户信号联合优化监督组件和 RL 策略,进一步提高推荐性能。我们将 LEA、状态模型和奖励模型与最先进的 RL 推荐系统结合使用,并在两个公开可用的数据集上报告了实验结果。

关键词

引用

@article{arxiv.2403.16948,
  title  = {Reinforcement Learning-based Recommender Systems with Large Language Models for State Reward and Action Modeling},
  author = {Jie Wang and Alexandros Karatzoglou and Ioannis Arapakis and Joemon M. Jose},
  journal= {arXiv preprint arXiv:2403.16948},
  year   = {2024}
}