一种基于聚类的动态数据流离群点检测方法(KORM: k-中位数离群点挖掘器)
分布式、并行与集群计算
2010-03-25 v1
摘要
由于数据流在各种应用中欺诈案件的增加,数据流中的离群点检测目前获得了广泛的重要性。离群点检测技术已被分为基于统计的、基于距离的、基于密度的或基于偏差的。到目前为止,欺诈检测领域的大部分工作都是基于距离的,但从计算角度来看,这种方法效率低下。本文介绍了一种新的基于聚类的方法,该方法将数据流分成块,并使用k-中位数将每个块聚类成可变数量的簇。我们不是将完整的数据流块存储在内存中,而是用挖掘数据流块后发现的加权中位数替换它,并将该信息与新到达的数据块一起传递到下一阶段。在每个阶段发现的加权中位数都会接受离群性测试,并在给定数量的阶段后,被声明为真正的离群点或内点。我们的方法在理论上优于k-均值,因为它不将簇的数量固定为k,而是给出一个范围,并提供更稳定、更好的解决方案,该方案在对数多项式空间内运行。
引用
@article{arxiv.1002.4003,
title = {A Cluster-based Approach for Outlier Detection in Dynamic Data Streams (KORM: k-median OutlieR Miner)},
author = {Parneeta Dhaliwal and M. P. S. Bhatia and Priti Bansal},
journal= {arXiv preprint arXiv:1002.4003},
year = {2010}
}