优化即时反馈与长期留存的序列推荐
信息检索
2024-06-11 v2
摘要
在推荐系统(RS)应用领域,强化学习(RL)最近已成为一种强大的工具,主要因为其在优化长期奖励方面的能力。然而,由于自举、离策略训练和函数逼近之间复杂的相互作用,它在学习过程中存在不稳定性。此外,在多奖励推荐场景中,设计一个能够协调各种任务内部动态的适当奖励设置相当复杂。针对这些挑战,我们引入了DT4IER,一种基于先进决策变换器的推荐模型,旨在不仅提升推荐效果,而且实现即时用户参与和长期留存之间的和谐平衡。DT4IER采用创新的多奖励设计,巧妙地平衡短期和长期奖励与用户特定属性,从而增强奖励序列的上下文丰富性,确保更明智和个性化的推荐过程。为了增强其预测能力,DT4IER集成了一个高维编码器,巧妙设计以识别和利用不同任务之间的复杂相互关系。此外,我们在动作嵌入预测中整合了对比学习方法,这一策略显著提升了模型的整体性能。在三个真实世界数据集上的实验表明,DT4IER在预测准确性和特定任务有效性方面均优于最先进的序列推荐系统(SRS)和多任务学习(MTL)模型。源代码已在线公开,便于复现。
引用
@article{arxiv.2404.03637,
title = {Sequential Recommendation for Optimizing Both Immediate Feedback and Long-term Retention},
author = {Ziru Liu and Shuchang Liu and Zijian Zhang and Qingpeng Cai and Xiangyu Zhao and Kesen Zhao and Lantao Hu and Peng Jiang and Kun Gai},
journal= {arXiv preprint arXiv:2404.03637},
year = {2024}
}
备注
SIGIR 2024