中文

一种用于地理参考数据K-means聚类的初始种子选择算法,以提高制图应用中簇分配的复现性

机器学习 2016-04-19 v1 数据结构与算法

摘要

K-means是各学科中应用最广泛的聚类算法之一,尤其适用于大型数据集。然而,该方法已知对簇中心的初始种子选择高度敏感。K-means++被提出以克服此问题,并已显示出比k-means更好的准确性和计算效率。但在许多聚类问题中——例如为制图应用对地理参考数据进行分类时——聚类方法的标准化,具体而言,该方法每次运行都能得到相同簇分配的能力(即方法的复现性),可能比任何感知的准确性度量更为重要,尤其是当已知解非唯一时,如k-means聚类的情况。在此,我们提出一种简单的k-means聚类初始种子选择算法,沿单一属性在数据集的“最深谷”或最大间隙处划定初始簇边界。因此,它引入了一种最大化连续簇中心间距离的度量,这增强了传统k-means最小化簇中心与簇成员间距离的优化。与现有初始化方法不同,该聚类算法未引入额外的参数或自由度。这使得簇分配的复现性相比k-means和k-means++提高了多达100%,实际上将不同运行间的方差降至零,且未向聚类过程引入任何额外参数。此外,所提方法比k-means++计算效率更高,且在某些情况下更准确。

关键词

引用

@article{arxiv.1604.04893,
  title  = {An Initial Seed Selection Algorithm for K-means Clustering of Georeferenced Data to Improve Replicability of Cluster Assignments for Mapping Application},
  author = {Fouad Khan},
  journal= {arXiv preprint arXiv:1604.04893},
  year   = {2016}
}

备注

Applied Soft Computing 12 (2012)