中文

评估:从精确率、召回率与F值到ROC、知情度、标记度与相关性

机器学习 2020-11-02 v1 统计方法学 机器学习

摘要

常用的评估度量包括召回率、精确率、F值和Rand准确率,它们存在偏差,若不明确理解这些偏差并相应识别该统计量的随机或基例水平,则不应使用。在这些常用度量下,一个在知情度(Informedness)客观意义上表现更差的系统,可能显得比在任何这些常用度量下表现更好。我们讨论了若干反映预测为有信息而非随机的概率的概念与度量。引入知情度,并提出标记度(Markedness)作为其双重度量,表示预测被标记而非随机的概率。最后我们展示了知情度、标记度、相关性与显著性之间的优雅联系,以及它们与召回率和精确率的直观关系,并概述了从二分类情形到一般多分类情形的推广。

关键词

引用

@article{arxiv.2010.16061,
  title  = {Evaluation: from precision, recall and F-measure to ROC, informedness, markedness and correlation},
  author = {David M. W. Powers},
  journal= {arXiv preprint arXiv:2010.16061},
  year   = {2020}
}

备注

27 pages, 7 figures. Updated and fixed egregious formatting errors (including a table overlapping text) that were introduced by the publisher. This open access journal appears to have been discontinued. arXiv admin note: text overlap with arXiv:1504.00854