我们的模型在 MovieLens 上表现优异:这意味着什么?
信息检索
2024-03-26 v3 人工智能
摘要
用于推荐系统(RecSys)评估的典型基准数据集由某一时间段内平台上产生的用户-物品交互组成。交互生成机制部分解释了用户为何与物品交互(如喜欢、购买、评分)以及特定交互发生时的上下文。在本研究中,我们对 MovieLens 数据集进行了细致分析,并阐释使用该数据集评估推荐算法的潜在影响。我们从分析中得出几点主要发现。首先,用户与 MovieLens 平台交互的不同阶段存在显著差异。早期交互在很大程度上定义了用户画像,进而影响后续交互。其次,用户交互受平台内部推荐算法所推荐候选电影的强烈影响。第三,改变用户交互的顺序会使序列算法更难捕捉渐进的交互过程。我们进一步讨论了 MovieLens 系统所采用的交互生成机制与典型现实世界推荐场景之间的差异。总之,MovieLens 平台展示了一种收集用户偏好以应对冷启动的高效方式。然而,在 MovieLens 数据集上取得优异推荐准确率的模型在实践中未必表现出优越性能,至少由于两类差异:(i)用户-物品交互生成上下文的差异,以及(ii)用户对物品集合认知的差异。尽管 MovieLens 上的结果可作为参考,但不应仅将其作为推荐系统模型有效性的主要依据。
引用
@article{arxiv.2307.09985,
title = {Our Model Achieves Excellent Performance on MovieLens: What Does it Mean?},
author = {Yu-chen Fan and Yitong Ji and Jie Zhang and Aixin Sun},
journal= {arXiv preprint arXiv:2307.09985},
year = {2024}
}