重新评估 Netflix Prize——人类不确定性及其对可靠性的影响
人机交互
2017-06-28 v1
摘要
本文从可靠性和人类不确定性的角度,审视推荐系统领域内比较评估的统计合理性。通过一项受控实验,我们洞察到用户在重复询问时会对相同项目给出不同评分。用户评分的这种波动性,为使用概率密度而非单一评分值的假设提供了依据。因此,众所周知的准确度指标(如 MAE、MSE、RMSE)本身也会产生一个密度,该密度由所有评分密度的卷积产生。当两个不同系统产生具有显著交叠的 RMSE 分布时,每种可能的排名都存在一个错误概率。作为应用,我们考察了 Netflix Prize 可能存在的排名错误。我们能够证明,所有顶级排名或多或少都面临较高的错误概率,并且某些排名可能被认为纯粹由偶然因素造成,而非系统质量所致。
引用
@article{arxiv.1706.08866,
title = {Re-Evaluating the Netflix Prize - Human Uncertainty and its Impact on Reliability},
author = {Kevin Jasberg and Sergej Sizov},
journal= {arXiv preprint arXiv:1706.08866},
year = {2017}
}