中文

SUBER:一个具有模拟人类行为的推荐系统强化学习环境

信息检索 2024-08-21 v2 机器学习

摘要

强化学习因其优化长期奖励和引导用户发现相关内容的能力,在推荐系统领域日益流行。然而,由于多种因素,包括用于训练在线策略方法的在线数据有限,强化学习在推荐系统中的成功实施颇具挑战性。这种数据稀缺性需要昂贵的人工交互来进行在线模型训练。此外,开发能够准确反映模型质量的有效评估框架仍然是推荐系统中的一个基本挑战。为应对这些挑战,我们提出了一个综合性的合成环境框架,该框架通过利用大型语言模型的能力来模拟人类行为。我们通过深入的消融研究来补充我们的框架,并通过电影和书籍推荐实验证明了其有效性。本工作使用大型语言模型作为合成用户,引入了一个模块化的新颖框架来训练基于强化学习的推荐系统。该软件(包括强化学习环境)已在GitHub上公开。

关键词

引用

@article{arxiv.2406.01631,
  title  = {SUBER: An RL Environment with Simulated Human Behavior for Recommender Systems},
  author = {Nathan Corecco and Giorgio Piatti and Luca A. Lanzendörfer and Flint Xiaofeng Fan and Roger Wattenhofer},
  journal= {arXiv preprint arXiv:2406.01631},
  year   = {2024}
}