中文

真实世界数据上的无监督异常检测算法:我们需要多少种

机器学习 2024-05-28 v1 人工智能

摘要

在本研究中,我们在52个真实世界多变量表格数据集上评估了32种无监督异常检测算法,进行了迄今最大规模的无监督异常检测算法比较。在该数据集集合上,kk-thNN(到第kk个最近邻的距离)算法显著优于绝大多数其他算法。对所有数据集上所考虑算法的相对性能进行可视化并聚类后,我们识别出两个清晰簇:一簇为“局部”数据集,另一簇为“全局”数据集。“局部”异常相较于邻近样本占据低密度区域,而“全局”异常占据特征空间中整体低密度区域。在局部数据集上,kkNN(kk-最近邻)算法居首。在全局数据集上,EIF(扩展孤立森林)算法表现最佳。同时考量算法计算复杂度,仅需包含这三种无监督异常检测算法的工具箱,便足以在该代表性多变量数据集集合中发掘异常。通过提供代码与数据集访问,我们的研究可被轻松复现并扩展更多算法和/或数据集。

关键词

引用

@article{arxiv.2305.00735,
  title  = {Unsupervised anomaly detection algorithms on real-world data: how many do we need?},
  author = {Roel Bouman and Zaharah Bukhsh and Tom Heskes},
  journal= {arXiv preprint arXiv:2305.00735},
  year   = {2024}
}

备注

The associated Git repository can be found at: https://github.com/RoelBouman/outlierdetection