中文

通过局部密度峰值搜索为 $k$-Means 类方法提供有效的确定性初始化

机器学习 2016-11-22 v1 计算机视觉与模式识别

摘要

kk-means 聚类算法很流行,但存在以下主要缺点:1)需要用户提前提供簇的数量 kk;2)随机选择初始中心时极易陷入局部极小值;3)对异常值敏感;4)只能处理分离良好的超球面簇。在本文中,我们提出了一种局部密度峰值搜索(LDPS)初始化框架来解决这些问题。LDPS 框架包含两个基本组件:一个是表征数据集密度分布的局部密度,另一个是我们引入的局部显著性指数(LDI),用于表征数据点与其相邻点相比的显著程度。基于这两个组件,我们搜索具有高局部密度和高 LDI 特征的局部密度峰值,以解决缺点 1)和 2)。此外,我们检测具有低局部密度但高 LDI 特征的异常值,并在聚类开始前将其排除。最后,我们将 LDPS 初始化框架应用于 kk-medoids,它是 kk-means 的一种变体,选择数据样本作为中心,并使用除欧氏距离外的多种相似性度量,以解决 kk-means 的最后一个缺点。将 LDPS 初始化框架与 kk-means 和 kk-medoids 相结合,我们分别获得了两种新的聚类方法,称为 LDPS-means 和 LDPS-medoids。在合成数据集上的实验验证了所提方法的有效性,特别是当簇数 kk 的真实值较大时。此外,在几个真实世界数据集(手写 Pendigits、Coil-20、Coil-100 和 Olivetti 人脸数据库)上的实验表明,无论是在估计 kk 还是在无监督目标分类方面,我们的方法均优于同类方法。

关键词

引用

@article{arxiv.1611.06777,
  title  = {Effective Deterministic Initialization for $k$-Means-Like Methods via Local Density Peaks Searching},
  author = {Fengfu Li and Hong Qiao and Bo Zhang},
  journal= {arXiv preprint arXiv:1611.06777},
  year   = {2016}
}

备注

16 pages, 9 figures, journal paper