中文

基于带深函数的 $k$-Means 函数型数据聚类初始化

应用统计 2021-06-03 v1

摘要

kk-Means 算法是最受欢迎的数据聚类方法之一,但众所周知其对初始化过程敏感。有大量方法旨在为 kk-Means 寻找最优初始种子,尽管它们中没有一种是普遍有效的。本文提出了其中一种方法——BRIk 算法——向纵向数据的扩展,该方法依赖于对从数据的自助法重复抽样得到的质心进行聚类,并使用通用的修正带深度(Modified Band Depth)。在我们的方法中,我们通过增加一个步骤来改进 BRIk 方法,即对我们的观测值拟合适当的 B 样条,以及一种重抽样过程,从而实现计算可行性并处理诸如噪声或缺失数据等问题。我们在模拟和真实数据集上的结果表明,我们针对 BRIK 方法的函数型数据方法(FABRIk)在为 kk-Means 提供初始化种子方面,就聚类恢复而言比以往的提案更有效。

关键词

引用

@article{arxiv.2106.01129,
  title  = {Band Depth based initialization of $k$-Means for functional data clustering},
  author = {Javier Albert-Smet and Aurora Torrente and Juan Romo},
  journal= {arXiv preprint arXiv:2106.01129},
  year   = {2021}
}