MSD-Kmeans:一种高效检测全局与局部离群点的新算法
机器学习
2023-12-22 v1 机器学习
摘要
离群点检测是数据挖掘中旨在检测数据集中不寻常或意外记录的技术。现有的离群点检测算法各有优缺点,并且对极值等噪声数据表现出不同的敏感性。在本文中,我们提出了一种名为 MSD-Kmeans 的基于聚类的新型离群点检测算法,它结合了均值与标准差(MSD)的统计方法与机器学习聚类算法 K-means,以更准确地检测离群点并更好地控制极值。这种 MSD-Kmeans 组合方法分为两个阶段:(1)应用 MSD 算法消除尽可能多的噪声数据,以最小化对聚类的干扰;(2)应用 K-means 算法获得局部最优聚类。我们评估了我们的算法,并在检测出租车可能超额收费的背景下证明了其有效性,因为贪婪不诚实的司机可能试图通过绕路收取高额车费。我们将 MSD-Kmeans 的性能指标与 MSD、K-means、Z-score、MIQR 和 LOF 等其他离群点检测算法进行比较,并证明所提出的 MSD-Kmeans 算法取得了最高的精确率、准确率和 F-measure。我们得出结论,MSD-Kmeans 可用于在 IoT 设备上对质量各异的数据进行高效且有效的离群点检测。
引用
@article{arxiv.1910.06588,
title = {MSD-Kmeans: A Novel Algorithm for Efficient Detection of Global and Local Outliers},
author = {Yuanyuan Wei and Julian Jang-Jaccard and Fariza Sabrina and Timothy McIntosh},
journal= {arXiv preprint arXiv:1910.06588},
year = {2023}
}
备注
12 pages, 5 figures, 2 tables