中文

基于 $\ell_{\infty}/\ell_0$ 惩罚的高维数据聚类稀疏 K-Means

机器学习 2019-02-25 v1 机器学习 统计方法学

摘要

稀疏聚类旨在对含有冗余噪声特征的极高维数据集进行恰当划分,近年来引起了越来越多的关注。现有研究通常在最大化加权特征贡献并受 2/1\ell_2/\ell_1 惩罚约束的框架下解决该问题。然而,该框架存在两个严重缺陷:一是该框架的解在许多情况下不可避免地包含相当比例的冗余噪声特征;二是该框架既不能直观解释为何能选择相关特征,也无法为特征选择一致性提供任何理论保证。本文试图通过开发一种使用 /0\ell_{\infty}/\ell_0 惩罚的新稀疏聚类框架来克服这些缺陷。首先,我们针对高维数据聚类问题引入了关于最优划分和噪声特征的新概念,基于这些概念可以从原理上直观地解释先前已知的框架。接着,我们应用建议的 /0\ell_{\infty}/\ell_0 框架构建了一个带有 /0\ell_{\infty}/\ell_0 惩罚的新稀疏 k-means 模型(简称 0\ell_0-k-means)。我们提出了一种高效迭代算法来求解 0\ell_0-k-means。为了深入理解 0\ell_0-k-means 的行为,我们证明了只要数据矩阵生成自高维高斯混合模型,0\ell_0-k-means 算法产生的解就具有特征选择一致性。最后,我们提供了合成数据和 Allen 发育小鼠脑图谱数据的实验结果,支持所提出的 0\ell_0-k-means 相较于先前已知的带 2/1\ell_2/\ell_1 惩罚的稀疏 k-means(简称 1\ell_1-k-means)表现出更优的噪声特征检测能力。

关键词

引用

@article{arxiv.1403.7890,
  title  = {Sparse K-Means with $\ell_{\infty}/\ell_0$ Penalty for High-Dimensional Data Clustering},
  author = {Xiangyu Chang and Yu Wang and Rongjian Li and Zongben Xu},
  journal= {arXiv preprint arXiv:1403.7890},
  year   = {2019}
}

备注

36 pages, 4 figures, Present the paper at ICSA 2013