一种对变量权重直接施加 $l_1$ 惩罚的强一致稀疏 $k$-means 聚类
机器学习
2019-03-26 v1 机器学习
摘要
我们提出了 Lasso 加权 -means(--means)算法,作为一种简单而高效的稀疏聚类过程,适用于特征数()远大于观测数()的高维数据。在 --means 算法中,我们直接在特征权重上引入基于 lasso 的惩罚项,以在稀疏聚类框架中引入特征选择。--means 不对给定数据集做任何分布假设,因此产生了一种非参数的特征选择方法。我们还解析地研究了 --means 中底层优化过程的收敛性,并建立了算法的强一致性。--means 在多个真实和合成数据集上进行了测试,通过详细的实验分析,我们发现该方法在聚类准确率和计算时间方面,与一些用于聚类和特征选择的 SOTA 方法相比均极具竞争力。
引用
@article{arxiv.1903.10039,
title = {A Strongly Consistent Sparse $k$-means Clustering with Direct $l_1$ Penalization on Variable Weights},
author = {Saptarshi Chakraborty and Swagatam Das},
journal= {arXiv preprint arXiv:1903.10039},
year = {2019}
}