深度嵌入 K-Means 聚类
机器学习
2021-10-01 v1
摘要
近来,深度聚类方法因深度神经网络(DNNs,如自编码器)的高表征能力而受到关注。其核心思想是表征学习与聚类可相互强化:好的表征带来好的聚类,而好的聚类为表征学习提供好的监督信号。关键问题包括:1) 如何优化表征学习与聚类?2) 是否总应考虑自编码器的重构损失?本文中我们提出 DEKM(即 Deep Embedded K-Means,深度嵌入 K-Means)来回答这两个问题。由于自编码器生成的嵌入空间可能无明显簇结构,我们提出进一步将嵌入空间变换到一个揭示簇结构信息的新空间。这通过一个正交变换矩阵实现,该矩阵包含 K-means 类内散度矩阵的特征向量。特征值指示了各特征向量对新空间中簇结构信息贡献的重要性。我们的目标是增强簇结构信息。为此,我们丢弃解码器并提出一种贪心方法来优化表征。表征学习与聚类由 DEKM 交替优化。在真实数据集上的实验结果表明 DEKM 达到了 SOTA 性能。
引用
@article{arxiv.2109.15149,
title = {Deep Embedded K-Means Clustering},
author = {Wengang Guo and Kaiyan Lin and Wei Ye},
journal= {arXiv preprint arXiv:2109.15149},
year = {2021}
}