基于离线强化学习的推荐系统因果决策Transformer
信息检索
2023-08-29 v2 人工智能
摘要
基于强化学习的推荐系统近年来受到广泛关注。然而,智能体赖以优化其推荐策略的奖励函数的设计通常并不直观。探索用户行为背后的因果关系可以取代奖励函数,引导智能体捕捉用户的动态兴趣。此外,由于仿真环境的典型局限(例如数据低效),大多数工作无法广泛应用于大规模场景。尽管一些研究尝试将离线数据集转换为模拟器,但数据低效使学习过程更加缓慢。由于强化学习的本质(即通过交互学习),它无法在单次交互中收集足够数据进行训练。此外,传统强化学习算法不像监督学习方法那样具备直接从离线数据集学习的扎实能力。本文提出一种名为推荐系统因果决策Transformer(CDT4Rec)的新模型。CDT4Rec是一种离线强化学习系统,可从数据集而非在线交互中学习。此外,CDT4Rec采用Transformer架构,能够处理大规模离线数据集并捕捉数据中的短期与长期依赖关系,以估计动作、状态和奖励之间的因果关系。为证明我们模型的可行性与优越性,我们在六个真实世界离线数据集和一个在线模拟器上进行了实验。
引用
@article{arxiv.2304.07920,
title = {Causal Decision Transformer for Recommender Systems via Offline Reinforcement Learning},
author = {Siyu Wang and Xiaocong Chen and Dietmar Jannach and Lina Yao},
journal= {arXiv preprint arXiv:2304.07920},
year = {2023}
}
备注
Accepted by SIGIR'23, please check the camera-ready version for more details such as the implementation