中文

特征数量对推荐算法性能的影响:基于Movielens-100K的案例研究

信息检索 2022-07-19 v1 机器学习

摘要

近期基于模型的推荐系统(RecSys)算法在设计上强调特征(亦称边信息)的使用,类似于机器学习(ML)中的算法。相比之下,一些最流行且传统的RecSys算法仅关注给定的用户-物品-评分关系而不包含边信息。本案例研究的目标是提供在包含边信息时RecSys与ML算法的性能比较与评估。我们选择了Movielens-100K数据集,因为它是比较RecSys算法的标准。我们比较了由基线数据生成的六个具有不同特征数量的特征集,并在总计19种RecSys算法、基线ML算法、自动机器学习(AutoML)流水线以及融合边信息的最先进RecSys算法上进行了评估。结果表明,额外特征使我们评估的所有算法受益。然而,对于AutoML和RecSys,特征数量与性能之间的相关性并非单调。在这些类别中,特征重要性分析揭示特征质量比数量更重要。在我们的整个实验中,就均方根误差而言,特征数最少的特性集上的平均性能比较特征数最多的约差6%。一个有趣的观察是,当使用额外特征时,AutoML优于基于矩阵分解的RecSys算法。几乎所有能包含边信息的算法在使用最高特征数量时都具有更高性能。在其他情况下,性能差异可忽略不计(<1%)。结果显示了特征数量影响的明确正向趋势,以及特征质量对所评估算法的重要影响。

关键词

引用

@article{arxiv.2207.08713,
  title  = {The Impact of Feature Quantity on Recommendation Algorithm Performance: A Movielens-100K Case Study},
  author = {Lukas Wegmeth},
  journal= {arXiv preprint arXiv:2207.08713},
  year   = {2022}
}