中文

面向流数据的在线簇有效性指标

机器学习 2018-01-10 v1 机器学习

摘要

聚类分析广泛用于探索无标签数据集中的结构。聚类分析的一个重要部分是验证计算所得聚类的质量。在离线环境下已开发了大量不同的内部指标用于验证。然而,该概念尚未扩展到在线环境。一个关键挑战是找到指标的高效增量形式,以在潜在无限数据流中捕捉聚类的凝聚性与分离性。本文开发了Xie-Beni和Davies-Bouldin内部有效性指标的两种在线版本(带与不带遗忘因子),并使用两种流聚类算法(sk-means与在线椭球聚类)分析其特性,展示了它们在监测流数据中演化聚类时的应用。我们还表明增量簇有效性指标能够在演化聚类出错时向在线监测器发送告警信号。数值实验表明,带遗忘因子的增量Xie-Beni指标优于所测试的其他三种指标。

关键词

引用

@article{arxiv.1801.02937,
  title  = {Online Cluster Validity Indices for Streaming Data},
  author = {Masud Moshtaghi and James C. Bezdek and Sarah M. Erfani and Christopher Leckie and James Bailey},
  journal= {arXiv preprint arXiv:1801.02937},
  year   = {2018}
}