中文

面向交互式推荐系统中长期用户反馈的验证

信息检索 2023-08-23 v1 机器学习

摘要

交互式推荐系统(IRS)因能够建模用户与推荐系统之间的交互过程而备受关注。大量方法采用了强化学习(RL)算法,因为这些算法可直接最大化用户的累积奖励。在 IRS 中,研究者通常利用公开可用的评论数据集来比较和评估算法。然而,公开数据集中提供的用户反馈仅包含即时响应(例如评分),并未包含延迟响应(例如停留时间与生命周期价值)。因此,这些评论数据集是否适合评估 IRS 的长期效应仍存疑问。本工作中,我们重新审视了基于评论数据集的 IRS 实验,并将基于 RL 的模型与一个简单贪婪推荐具有最高单步奖励物品的奖励模型进行比较。经过广泛分析,我们揭示了三个主要发现:第一,简单的贪婪奖励模型在最大化累积奖励上持续优于基于 RL 的模型;第二,对长期奖励施加更高权重会导致推荐性能下降;第三,在基准数据集上用户反馈仅具有极弱长期效应。基于我们的发现,我们得出结论:数据集必须被谨慎验证,且恰当评估基于 RL 的 IRS 方法时应纳入简单的贪婪基线。

关键词

引用

@article{arxiv.2308.11137,
  title  = {Towards Validating Long-Term User Feedbacks in Interactive Recommendation Systems},
  author = {Hojoon Lee and Dongyoon Hwang and Kyushik Min and Jaegul Choo},
  journal= {arXiv preprint arXiv:2308.11137},
  year   = {2023}
}

备注

Accepted to SIGIR'22