基于随机奖励稳定化的无模型强化学习推荐系统
机器学习
2023-08-28 v1 信息检索
摘要
基于无模型 RL 的推荐系统近来因能处理部分反馈与长期奖励而受到越来越多研究关注。然而,多数现有研究忽略了一个推荐系统中的关键特征:同一用户在不同时间对相同条目的反馈是随机的。随机奖励属性本质上不同于具有确定性奖励的经典 RL 场景,这使得基于 RL 的推荐系统更具挑战性。本文首先在一个模拟器环境中证明,使用直接随机反馈会导致性能显著下降。随后为更高效处理随机反馈,我们设计了两种随机奖励稳定化框架,以由监督模型学习到的反馈替代直接随机反馈。两种框架均为模型无关,即它们可有效利用各类监督模型。我们在推荐模拟器及工业级推荐系统上的大量实验证明了所提框架相对于不同基于 RL 的推荐基线的优越性。
引用
@article{arxiv.2308.13246,
title = {Model-free Reinforcement Learning with Stochastic Reward Stabilization for Recommender Systems},
author = {Tianchi Cai and Shenliao Bao and Jiyan Jiang and Shiji Zhou and Wenpeng Zhang and Lihong Gu and Jinjie Gu and Guannan Zhang},
journal= {arXiv preprint arXiv:2308.13246},
year = {2023}
}
备注
SIGIR '23