人类不确定性与排序误差——预测性数据挖掘中成功评估的奥秘
人机交互
2017-08-21 v1 人工智能
摘要
数据挖掘中最关键的问题之一是建模人类行为,以提供个性化、自适应和推荐服务。这通常涉及隐式或显式知识,要么通过观察用户交互,要么直接询问用户。但这些信息来源总是受到人类决策波动性的影响,使得所利用的数据在一定程度上具有不确定性。在本文中,我们详细阐述了这种人类不确定性在比较评估不同数据挖掘方法时的影响。特别地,我们揭示了两个问题:(1) 对基于模型预测的各种度量指标的偏置效应,以及 (2) 不确定性的传播及其由此引发的算法排序错误概率。为此,我们引入了一种概率视角,并从数学上证明了这些问题的存在,同时提供了可能的解决策略。我们主要以推荐系统为背景,并以均方根误差(RMSE)这一精度质量度量的典型例子来例证我们的理论。
引用
@article{arxiv.1708.05688,
title = {Human Uncertainty and Ranking Error -- The Secret of Successful Evaluation in Predictive Data Mining},
author = {Kevin Jasberg and Sergej Sizov},
journal= {arXiv preprint arXiv:1708.05688},
year = {2017}
}