中文

面向基于深度强化学习推荐的即插即用模型无关反事实策略合成

信息检索 2023-11-02 v3

摘要

推荐系统的最新进展证明了强化学习(RL)处理用户与推荐系统之间动态演化过程的潜力。然而,在推荐系统背景下,由于用户反馈数据通常稀疏,训练一个最优 RL 智能体一般并不现实。为规避当前基于 RL 的推荐系统交互不足的问题,我们提出学习一种通用的模型无关反事实合成(MACS)策略,用于反事实用户交互数据增强。该反事实合成策略旨在合成反事实状态,同时保留原始状态中与用户兴趣相关的显著信息,这建立在我们所设计的两种不同训练方法之上:基于专家示范的学习与联合训练。因此,每个反事实数据的合成基于当前推荐智能体与环境的交互,以适应用户的动态兴趣。我们将所提策略与深度确定性策略梯度(DDPG)、软演员-评论家(SAC)和双延迟 DDPG 集成于一个自适应流水线中,配以可生成反事实数据以提升推荐性能的推荐智能体。在在线模拟与离线数据集上的实证结果证明了我们反事实合成策略的有效性与泛化能力,并验证了其改善 RL 推荐智能体性能的作用。

关键词

引用

@article{arxiv.2208.05142,
  title  = {Plug-and-Play Model-Agnostic Counterfactual Policy Synthesis for Deep Reinforcement Learning based Recommendation},
  author = {Siyu Wang and Xiaocong Chen and Lina Yao and Sally Cripps and Julian McAuley},
  journal= {arXiv preprint arXiv:2208.05142},
  year   = {2023}
}

备注

Accepted by IEEE TNNLS