中文

一种对变量权重直接施加 $l_1$ 惩罚的强一致稀疏 $k$-means 聚类

机器学习 2019-03-26 v1 机器学习

摘要

我们提出了 Lasso 加权 kk-means(LWLW-kk-means)算法,作为一种简单而高效的稀疏聚类过程,适用于特征数(pp)远大于观测数(nn)的高维数据。在 LWLW-kk-means 算法中,我们直接在特征权重上引入基于 lasso 的惩罚项,以在稀疏聚类框架中引入特征选择。LWLW-kk-means 不对给定数据集做任何分布假设,因此产生了一种非参数的特征选择方法。我们还解析地研究了 LWLW-kk-means 中底层优化过程的收敛性,并建立了算法的强一致性。LWLW-kk-means 在多个真实和合成数据集上进行了测试,通过详细的实验分析,我们发现该方法在聚类准确率和计算时间方面,与一些用于聚类和特征选择的 SOTA 方法相比均极具竞争力。

关键词

引用

@article{arxiv.1903.10039,
  title  = {A Strongly Consistent Sparse $k$-means Clustering with Direct $l_1$ Penalization on Variable Weights},
  author = {Saptarshi Chakraborty and Swagatam Das},
  journal= {arXiv preprint arXiv:1903.10039},
  year   = {2019}
}