中文

基于测度传播的深度聚类

机器学习 2021-04-27 v3 计算与语言

摘要

深度模型已改进了监督学习与无监督学习的当前最优水平。例如,深度嵌入聚类(DEC)通过使用堆叠自编码器进行表示学习,极大提升了无监督聚类性能。然而,深度建模的一个弱点是原始空间中的局部邻域结构不一定在潜空间中得以保持。为了保留局部几何结构,监督与半监督学习文献中已提出多种方法(例如谱聚类和标签传播)使用图拉普拉斯正则化。在本文中,我们将深度表示学习的优势与测度传播(MP)相结合,MP 是一种基于 KL 散度的图正则化方法,最初用于半监督场景。MP 的主要假设是:若两个数据点在原始空间中接近,则它们很可能属于同一类,由类隶属度分布的 KL 散度度量。通过在无监督学习场景中采用相同假设,我们提出了由测度传播辅助的深度嵌入聚类(DECAMP)模型。我们在短文本聚类任务上评估了 DECAMP。在三个公开数据集上,DECAMP 与其他当前最优基线(包括使用额外数据生成聚类过程中所用词嵌入的基线)相比具有竞争力。例如,在 Stackoverflow 数据集上,DECAMP 取得了 79% 的聚类准确率,比所有现有基线高出约 5%。这些实证结果表明 DECAMP 是一种非常有效的无监督学习方法。

关键词

引用

@article{arxiv.2104.08967,
  title  = {Deep Clustering with Measure Propagation},
  author = {Minhua Chen and Badrinath Jayakumar and Padmasundari Gopalakrishnan and Qiming Huang and Michael Johnston and Patrick Haffner},
  journal= {arXiv preprint arXiv:2104.08967},
  year   = {2021}
}

备注

This work was presented as a poster in 14th Annual Machine Learning Symposium in The New York Academy of Sciences