真实世界数据上的无监督异常检测算法:我们需要多少种
机器学习
2024-05-28 v1 人工智能
摘要
在本研究中,我们在52个真实世界多变量表格数据集上评估了32种无监督异常检测算法,进行了迄今最大规模的无监督异常检测算法比较。在该数据集集合上,-thNN(到第个最近邻的距离)算法显著优于绝大多数其他算法。对所有数据集上所考虑算法的相对性能进行可视化并聚类后,我们识别出两个清晰簇:一簇为“局部”数据集,另一簇为“全局”数据集。“局部”异常相较于邻近样本占据低密度区域,而“全局”异常占据特征空间中整体低密度区域。在局部数据集上,NN(-最近邻)算法居首。在全局数据集上,EIF(扩展孤立森林)算法表现最佳。同时考量算法计算复杂度,仅需包含这三种无监督异常检测算法的工具箱,便足以在该代表性多变量数据集集合中发掘异常。通过提供代码与数据集访问,我们的研究可被轻松复现并扩展更多算法和/或数据集。
引用
@article{arxiv.2305.00735,
title = {Unsupervised anomaly detection algorithms on real-world data: how many do we need?},
author = {Roel Bouman and Zaharah Bukhsh and Tom Heskes},
journal= {arXiv preprint arXiv:2305.00735},
year = {2024}
}
备注
The associated Git repository can be found at: https://github.com/RoelBouman/outlierdetection