中文

面向推荐系统因果推断的半合成数据集生成框架

信息检索 2022-02-24 v1

摘要

准确的推荐与可靠的解释是现代推荐系统的两个关键问题。然而,大多数推荐基准仅关注用户-物品评分的预测,而忽略了评分背后的潜在原因。例如,广泛使用的 Yahoo!R3 数据集几乎不含用户-电影评分原因的信息。一种解决方案是开展调查并要求用户提供此类信息。实践中,用户调查很难避免依从性问题与用户响应稀疏,这极大阻碍了基于因果的推荐探索。为更好支持推荐系统中因果推断及进一步解释的研究,我们提出一种新颖的推荐系统半合成数据生成框架,其中采用带缺失性的因果图模型描述实际推荐场景的因果机制。为说明框架用法,我们基于从著名电影评分网站收集的电影及其描述性标签与评分信息,构建了带因果标签与评分(CTAR)的半合成数据集。利用所收集数据与因果图,用户-物品-评分及其对应的用户-物品-标签被自动生成,提供了用户给物品评分的原因(所选标签)。我们也报告了关于 CTAR 数据集的描述性统计与基线结果。所提数据生成框架不限于推荐,发布的 API 可用于生成面向其他研究任务的定制数据集。

关键词

引用

@article{arxiv.2202.11351,
  title  = {A Semi-Synthetic Dataset Generation Framework for Causal Inference in Recommender Systems},
  author = {Yan Lyu and Sunhao Dai and Peng Wu and Quanyu Dai and Yuhao Deng and Wenjie Hu and Zhenhua Dong and Jun Xu and Shengyu Zhu and Xiao-Hua Zhou},
  journal= {arXiv preprint arXiv:2202.11351},
  year   = {2022}
}

备注

10 pages, 6 figures, 4 tables