中文

面向演化数据流的 K-means 聚类

机器学习 2021-09-20 v2 机器学习

摘要

当前全球产生的数据量正以无法估量的速度增长,因此必须持续处理大量无监督数据。聚类是主要的无监督数据分析方法之一。在流式数据场景中,数据由不断增长的样本批次序列组成,并可能发生概念漂移现象。本文正式定义了流式 K-means(SKKM)问题,该问题意味着当概念漂移发生时误差函数需重启。我们提出了一种不依赖于概念漂移检测的代理误差函数。我们证明了该代理函数是 SKKM 误差的良好近似。因此,我们提出了一种算法,在每批新数据到达时最小化这一替代误差。我们还给出了一些面向流式数据场景的初始化技术。除提供理论结果外,实验表明非平凡初始化方法在收敛误差上有所改善。

关键词

引用

@article{arxiv.2012.03628,
  title  = {K-means for Evolving Data Streams},
  author = {Arkaitz Bidaurrazaga and Aritz Pérez and Marco Capó},
  journal= {arXiv preprint arXiv:2012.03628},
  year   = {2021}
}

备注

This is a extended version of a short paper published in ICDM 2021. Please cite the short paper instead of this version. As soon as it is published we will add how to reference it