中文

从非典型行为中学习:基于强化学习的临时兴趣感知推荐

信息检索 2022-01-19 v1

摘要

传统的鲁棒推荐方法将非典型的用户-物品交互视为噪声,并旨在利用某种噪声过滤技术降低其影响,这通常面临两个挑战。首先,在真实世界中,非典型交互可能表征用户不同于其一般偏好的临时兴趣。因此,简单地将非典型交互作为噪声过滤掉可能是不恰当的,并会削弱推荐的个性化。其次,由于不存在显式监督信号来指示某次交互是否非典型,难以获取临时兴趣。为应对这些挑战,我们提出一种称为临时兴趣感知推荐(TIARec)的新模型,其可在无监督下区分非典型与正常交互,并捕捉用户的临时兴趣及一般偏好。具体而言,我们提出一个包含推荐智能体与辅助分类智能体的强化学习框架,二者以最大化推荐智能体所产生推荐的累积回报为目标联合训练。在联合训练过程中,分类智能体可判断与推荐智能体所荐物品的交互是否非典型,且从非典型交互学习临时兴趣的知识可迁移至推荐智能体,使推荐智能体能够单独做出兼顾用户一般偏好与临时兴趣的推荐。最后,在真实数据集上的实验验证了 TIARec 的有效性。

关键词

引用

@article{arxiv.2201.05970,
  title  = {Learning from Atypical Behavior: Temporary Interest Aware Recommendation Based on Reinforcement Learning},
  author = {Ziwen Du and Ning Yang and Zhonghua Yu and Philip S. Yu},
  journal= {arXiv preprint arXiv:2201.05970},
  year   = {2022}
}