变分自编码器梯度聚类
机器学习
2021-05-14 v1
摘要
近年来,使用深度神经网络模型的聚类得到了广泛研究。其中最流行的框架包括 VAE 和 GAN 框架,它们通过编码器/解码器神经网络结构学习数据的潜在特征表示。这作为聚类任务的合适基础,因为潜在空间往往能有效捕捉数据的固有本质,简化其流形并降低噪声。本文使用 VAE 框架研究如何通过对数据点进行概率函数梯度上升来处理数据,以实现更好的聚类。与未处理数据相比,观察到分类有所改善,尽管未获得 SOTA 结果。然而,使用梯度下降处理数据会导致更明显的簇分离,使考察合适超参数设置(如簇数)更为简单。我们提出了一种简单而有效的方法,基于 DBSCAN 聚类算法来考察数据的合适簇数,并证明梯度处理有助于簇数确定。作为额外的发现,我们发现用于比较的基线模型——在训练期间重构权重为 1 的 VAE 结构(自编码器)的 t-SNE 潜在空间上的 GMM——在 MNIST 数据上取得了 SOTA 结果,据我们所知未被任何其他现有模型超越。
引用
@article{arxiv.2105.06246,
title = {Variational Auto Encoder Gradient Clustering},
author = {Adam Lindhe and Carl Ringqvist and Henrik Hult},
journal= {arXiv preprint arXiv:2105.06246},
year = {2021}
}