Netflix 挑战的统计显著性
统计方法学
2012-07-25 v1
摘要
受 Netflix 竞赛遗产的启发,我们概述了从我们自身及他人的努力中学到的关于协同过滤和推荐系统问题的知识。数据集包含约 1 亿条电影评分(1 至 5 星),涉及约 48 万用户和约 1.8 万部电影;相关的评分矩阵稀疏度约为 99%。目标是预测用户对电影的评分;能够准确做到这一点的系统具有重要的商业应用,特别是在万维网上。我们详细讨论了“基线”建模、奇异值分解 (SVD) 以及 NN(最近邻)和神经网络模型等方法;同时也讨论了时间效应、交叉验证问题、集成方法和其他考量因素。我们在寻找新模型的过程中比较了现有模型,并讨论了当参数空间维度达到数百万时出现的惩罚和参数收缩等关键任务问题。尽管计算机科学与机器学习界已对此类问题开展了大量工作,但我们的目标是面向统计受众,并提供主要从统计学角度对从这一非凡数据集中学到的经验教训的阐述。
引用
@article{arxiv.1207.5649,
title = {Statistical Significance of the Netflix Challenge},
author = {Andrey Feuerverger and Yu He and Shashi Khatri},
journal= {arXiv preprint arXiv:1207.5649},
year = {2012}
}
备注
Published in at http://dx.doi.org/10.1214/11-STS368 the Statistical Science (http://www.imstat.org/sts/) by the Institute of Mathematical Statistics (http://www.imstat.org)