一种鲁棒且稀疏的 K-means 聚类算法
机器学习
2012-01-31 v1
摘要
在许多关注识别聚类的情形中,人们可能预期并非所有可用变量都携带关于这些组的信息。此外,数据质量(例如离群值或缺失项)可能对大型复杂数据集构成严重且有时难以评估的问题。在本文中,我们表明少量非典型观测值可能会对 Witten 和 Tibshirani (2010) 的稀疏聚类算法所找到的解产生严重的不利影响。我们基于 Cuesta-Albertos 等人 (1997) 的修剪 K-means 算法,提出了对他们稀疏 K-means 算法的鲁棒化改进。我们的方案也能够处理含有缺失值的数据集。我们在癌症患者的微阵列数据上展示了我们方法的使用,能够以显著减少的基因数量识别出强烈的生物学聚类。我们的模拟研究表明,当数据中存在离群值时,我们的鲁棒稀疏 K-means 算法在特征选择和识别聚类方面均优于其他竞争方法。该鲁棒稀疏 K-means 算法已实现在 R 包 RSKC 中,可从 CRAN 仓库公开获取。
引用
@article{arxiv.1201.6082,
title = {A robust and sparse K-means clustering algorithm},
author = {Yumi Kondo and Matias Salibian-Barrera and Ruben Zamar},
journal= {arXiv preprint arXiv:1201.6082},
year = {2012}
}