中文

对抗深度嵌入聚类:在特征随机性与特征漂移之间取得更好权衡

机器学习 2019-09-27 v1 机器学习

摘要

使用深度自编码器的聚类在近年来已被深入研究。现有方法依赖于同时学习嵌入特征并在潜空间中对数据点聚类。尽管众多深度聚类方法在多个高语义数据集上取得了优于浅层模型的结果,但此类模型的一个关键弱点被忽视了。在缺乏具体监督信号的情况下,嵌入聚类目标函数可能通过不可靠的伪标签学习而扭曲潜空间。因此,网络可能学到非代表性特征,进而削弱判别能力,产生更差的伪标签。为缓解随机判别特征的影响,现代基于自编码器的聚类论文提出使用重构损失进行预训练并在聚类阶段作为正则化器。然而,聚类-重构权衡会导致所谓的“特征漂移”现象。本文中,我们提出 ADEC(对抗深度嵌入聚类),一种新颖的基于自编码器的聚类模型,其利用对抗训练解决双重问题,即“特征随机性”与“特征漂移”。我们通过基准真实数据集实证展示了我们的模型在处理这些问题上的适用性。实验结果验证了我们的模型优于最先进的基于自编码器的聚类方法。

关键词

引用

@article{arxiv.1909.11832,
  title  = {Adversarial Deep Embedded Clustering: on a better trade-off between Feature Randomness and Feature Drift},
  author = {Nairouz Mrabah and Mohamed Bouguessa and Riadh Ksantini},
  journal= {arXiv preprint arXiv:1909.11832},
  year   = {2019}
}