推荐系统中的强化学习状态编码器:一项可复现性研究
信息检索
2022-05-12 v2
摘要
用于推荐的强化学习(RL4Rec)方法因能快速适应用户反馈而日益受到关注。一个典型的 RL4Rec 框架包括(1)一个状态编码器,用于编码存储用户历史交互的状态,以及(2)一个 RL 方法,用于采取动作并观测奖励。先前的工作在基于真实世界日志用户数据模拟用户反馈的环境中比较了四种状态编码器。基于注意力的状态编码器因达到最高性能而被认为是最优选择。然而,该发现仅限于 actor-critic 方法、四种状态编码器以及未对日志用户数据去偏的评估模拟器。针对这些不足,我们复现并扩展了现有基于注意力的状态编码器的比较:(1)在公开可用的去偏 RL4Rec SOFA 模拟器中,(2)使用一种不同的 RL 方法,(3)更多的状态编码器,以及(4)一个不同的数据集。重要的是,我们的实验结果表明,当与更多状态编码器比较时,现有发现并不能推广到由不同数据集生成的去偏 SOFA 模拟器以及基于 Deep Q-Network (DQN) 的方法。
引用
@article{arxiv.2205.04797,
title = {State Encoders in Reinforcement Learning for Recommendation: A Reproducibility Study},
author = {Jin Huang and Harrie Oosterhuis and Bunyamin Cetinkaya and Thijs Rood and Maarten de Rijke},
journal= {arXiv preprint arXiv:2205.04797},
year = {2022}
}
备注
SIGIR 2022