如何评估无监督异常检测算法的质量?
机器学习
2016-07-06 v1 机器学习
摘要
当充足标注数据可用时,基于接收者操作特征(ROC)或精确率-召回率(PR)曲线的经典准则可用于比较无监督异常检测算法的性能。然而,在许多情况下,很少或没有数据被标注。这需要能够在无标注数据上计算的替代准则。在本文中,两个不需要标签的准则被经验性地证明能准确区分(相对于基于ROC或PR的准则)算法之间。这些准则基于现有的超额质量(EM)和质量-体积(MV)曲线,这些曲线通常在高维中无法很好估计。还描述并测试了一种基于特征子采样和聚合的方法,将这些准则的使用扩展到高维数据集,并解决了标准EM和MV曲线固有的主要缺陷。
引用
@article{arxiv.1607.01152,
title = {How to Evaluate the Quality of Unsupervised Anomaly Detection Algorithms?},
author = {Nicolas Goix},
journal= {arXiv preprint arXiv:1607.01152},
year = {2016}
}