中文

将 MovieLens-32M 扩展以提供新的评估目标

信息检索 2025-04-29 v2

摘要

离线评估推荐系统传统上将其视为机器学习问题。在经典的电影推荐情况下,用户已对他们喜欢和不喜欢的电影提供明确评分,将每个用户的评分划分为测试集和训练集,评估任务变为使用训练数据预测保留的测试数据。这种机器学习风格的评估使目标成为推荐用户已观看并给予高评分的电影,而这并非帮助用户发现他们如果观看电影会喜欢的电影的同一任务。为了避免要求用户通过观看每部电影来评估推荐而不得不作出的妥协,导致目标与任务之间的不匹配。我们提供了 MovieLens-32M 数据集的扩展,提供了新的评估目标。我们的主要目标是预测用户会对哪些电影感兴趣观看,即预测他们的观看列表。为构建此扩展,我们招募了 MovieLens 用户,收集了他们的个人资料,使用多样化的算法进行推荐,将推荐结果进行汇总,并让用户对这些汇总进行评估。本文演示了使用汇总方法构建推荐系统测试集合的可行性。值得注意的是,我们发现传统机器学习风格的评估将 Popular 算法排名居中,该算法基于系统中电影总评分数进行推荐。相比之下,当我们按用户对观看电影兴趣排序时,我们发现将流行电影作为推荐算法的运行结果会在我们用于构建汇总的二十二次推荐运行中表现最差。显然,通过要求用户评估他们的个人推荐,我们可以缓解顶部 n 推荐评估中流行偏差的问题。

关键词

引用

@article{arxiv.2504.01863,
  title  = {Extending MovieLens-32M to Provide New Evaluation Objectives},
  author = {Mark D. Smucker and Houmaan Chamani},
  journal= {arXiv preprint arXiv:2504.01863},
  year   = {2025}
}

备注

This is a preprint. The definitive version was published in SIGIR 2025 ( https://doi.org/10.1145/3726302.3730328 ). Our extension to MovieLens-32M is available for researchers at https://uwaterlooir.github.io/datasets/ml-32m-extension