中文

具有序列奖励交互的推荐列表反事实评估

机器学习 2020-08-25 v2 信息检索 机器学习

摘要

音乐流媒体、视频流媒体、新闻推荐和电子商务服务的用户通常以序列方式与内容互动。因此,提供和评估良好的推荐序列是这些服务的核心问题。现有的基于重加权的反事实评估方法要么方差较高,要么对奖励做出强独立性假设。我们提出了一种新的反事实估计器,该估计器允许奖励中存在序列交互,同时以渐近无偏的方式实现更低的方差。我们的方法利用关于推荐列表因果关系的图模型假设,对日志策略中的奖励进行重加权,以近似目标策略下的期望奖励总和。在模拟环境和真实推荐系统上进行的大量实验表明,在序列音轨推荐问题上,我们的方法在偏差和数据效率方面均优于现有方法。

关键词

引用

@article{arxiv.2007.12986,
  title  = {Counterfactual Evaluation of Slate Recommendations with Sequential Reward Interactions},
  author = {James McInerney and Brian Brost and Praveen Chandar and Rishabh Mehrotra and Ben Carterette},
  journal= {arXiv preprint arXiv:2007.12986},
  year   = {2020}
}