中文

推荐系统中基于强化学习的序列自适应

信息检索 2021-08-04 v1 人工智能 机器学习

摘要

考虑到用户具有不同的序列模式,现有推荐策略的主要缺点是需要固定长度的用户-物品交互序列作为输入来训练模型。这可能会限制推荐准确性,因为实际上用户在序列推荐中遵循不同的趋势。因此,基线策略可能会忽略重要的序列交互,或者根据用户序列行为的多样性,向模型添加冗余交互的噪声。为了解决这个问题,本研究提出了SAR模型,它不仅学习序列模式,而且以个性化方式调整用户-物品交互的序列长度。我们首先设计了一个演员-评论家框架,其中RL代理试图根据用户在特定时间步的状态表示,计算最优序列长度作为动作。此外,我们优化了一个联合损失函数,以使序列推荐的准确性与评论家网络的预期累积奖励对齐,同时通过演员网络以个性化方式调整序列长度。我们在四个真实世界数据集上的实验评估证明了我们提出的模型相对于几种基线方法的优越性。最后,我们在https://github.com/stefanosantaris/sar公开了我们的实现。

关键词

引用

@article{arxiv.2108.01442,
  title  = {Sequence Adaptation via Reinforcement Learning in Recommender Systems},
  author = {Stefanos Antaris and Dimitrios Rafailidis},
  journal= {arXiv preprint arXiv:2108.01442},
  year   = {2021}
}