中文

异常检测:如何通过有偏评估协议人为抬高你的 F1-Score

机器学习 2021-07-01 v1

摘要

异常检测是机器学习中被广泛探索的领域。文献中提出了许多模型,并通过在各种数据集上测量的不同指标进行比较。用于比较性能的最流行指标是 F1-score、AUC 和 AVPR。在本文中,我们表明 F1-score 和 AVPR 对污染率高度敏感。一个后果是,可以通过修改训练-测试划分过程来人为地提高其数值。这导致文献中算法之间的误导性比较,尤其是在评估协议未被详尽说明时。此外,我们表明 F1-score 和 AVPR 不能用于比较不同数据集上的性能,因为它们不能反映对此类数据建模的内在难度。基于这些观察,我们主张 F1-score 和 AVPR 不应作为异常检测的指标使用。我们推荐一种用于无监督异常检测的通用评估流程,包括使用其他更鲁棒于评估协议中任意选择的指标,如 AUC。

关键词

引用

@article{arxiv.2106.16020,
  title  = {Anomaly Detection: How to Artificially Increase your F1-Score with a Biased Evaluation Protocol},
  author = {Damien Fourure and Muhammad Usama Javaid and Nicolas Posocco and Simon Tihon},
  journal= {arXiv preprint arXiv:2106.16020},
  year   = {2021}
}

备注

16 pages, 7 figures, to be published in ECML-PKDD 2021, for official implementation see https://github.com/euranova/F1-Score-is-Biased