将离线强化学习与 Transformer 结合用于序列推荐
信息检索
2023-07-28 v1
摘要
我们考虑序列推荐问题,即基于过往交互做出当前推荐。该推荐任务需要对序列数据进行高效处理,并旨在提供能最大化长期奖励的推荐。为此,我们使用一种离线强化学习(RL)算法来训练一个具有远见卓识的推荐器,其模型架构中的策略网络已由预训练的 Transformer 模型初始化。该预训练模型利用了 Transformer 处理序列信息的卓越能力。与依赖通过模拟进行在线交互的先前工作相比,我们专注于实现一个能够快速且稳定收敛的全离线 RL 框架。通过在公开数据集上的大量实验,我们表明我们的方法在包括电子商务和电影推荐在内的多种推荐场景中均具有鲁棒性。与最先进的监督学习算法相比,我们的算法能产出更高质量的推荐,展示了结合 RL 与 Transformer 的明显优势。
引用
@article{arxiv.2307.14450,
title = {Integrating Offline Reinforcement Learning with Transformers for Sequential Recommendation},
author = {Xumei Xi and Yuke Zhao and Quan Liu and Liwen Ouyang and Yang Wu},
journal= {arXiv preprint arXiv:2307.14450},
year = {2023}
}