无监督异常检测中污染因子分布的估计
机器学习
2023-10-19 v2 机器学习
摘要
异常检测方法通常以无监督方式,基于各种启发式方法为样本分配实值异常分数,从而识别不符合预期行为的样本。这些分数需要通过阈值化转换为实际预测,以使被标记为异常的样本比例等于预期的异常比例,即所谓污染因子。遗憾的是,目前尚无良好方法用于估计污染因子本身。我们从贝叶斯视角解决该需求,引入一种估计给定无标签数据集污染因子后验分布的方法。我们利用若干异常检测器的输出作为已捕捉异常性基本概念的表示,并使用特定的混合公式估计污染因子。在 22 个数据集上的实证表明,所估计的分布校准良好,且使用后验均值设定阈值相较若干替代方法提升了异常检测器的性能。所有代码公开可用以保证完全可复现。
引用
@article{arxiv.2210.10487,
title = {Estimating the Contamination Factor's Distribution in Unsupervised Anomaly Detection},
author = {Lorenzo Perini and Paul Buerkner and Arto Klami},
journal= {arXiv preprint arXiv:2210.10487},
year = {2023}
}