通过局部密度峰值搜索为 $k$-Means 类方法提供有效的确定性初始化
机器学习
2016-11-22 v1 计算机视觉与模式识别
摘要
-means 聚类算法很流行,但存在以下主要缺点:1)需要用户提前提供簇的数量 ;2)随机选择初始中心时极易陷入局部极小值;3)对异常值敏感;4)只能处理分离良好的超球面簇。在本文中,我们提出了一种局部密度峰值搜索(LDPS)初始化框架来解决这些问题。LDPS 框架包含两个基本组件:一个是表征数据集密度分布的局部密度,另一个是我们引入的局部显著性指数(LDI),用于表征数据点与其相邻点相比的显著程度。基于这两个组件,我们搜索具有高局部密度和高 LDI 特征的局部密度峰值,以解决缺点 1)和 2)。此外,我们检测具有低局部密度但高 LDI 特征的异常值,并在聚类开始前将其排除。最后,我们将 LDPS 初始化框架应用于 -medoids,它是 -means 的一种变体,选择数据样本作为中心,并使用除欧氏距离外的多种相似性度量,以解决 -means 的最后一个缺点。将 LDPS 初始化框架与 -means 和 -medoids 相结合,我们分别获得了两种新的聚类方法,称为 LDPS-means 和 LDPS-medoids。在合成数据集上的实验验证了所提方法的有效性,特别是当簇数 的真实值较大时。此外,在几个真实世界数据集(手写 Pendigits、Coil-20、Coil-100 和 Olivetti 人脸数据库)上的实验表明,无论是在估计 还是在无监督目标分类方面,我们的方法均优于同类方法。
关键词
引用
@article{arxiv.1611.06777,
title = {Effective Deterministic Initialization for $k$-Means-Like Methods via Local Density Peaks Searching},
author = {Fengfu Li and Hong Qiao and Bo Zhang},
journal= {arXiv preprint arXiv:1611.06777},
year = {2016}
}
备注
16 pages, 9 figures, journal paper