中文

Dying Clusters Is All You Need——基于未知簇数的深层聚类方法

机器学习 2024-10-15 v1 人工智能

摘要

在缺乏标签数据的情况下,从高维数据(如图像或文本)中寻找有意义的群体(即簇)是数据挖掘中的重要挑战。近年来,深度聚类方法在此类任务中取得了显著成果。然而,这些方法大多需要用户提前指定簇的数量。这是一个主要限制,因为当标签数据不可用时,簇的数量通常是未知的。因此,一个研究领域涌现出来,旨在解决这一问题。大多数方法估计簇的数量时会与聚类过程分离,这导致聚类结果严重依赖于初始嵌入的质量。其他方法则针对特定的聚类过程设计,难以适用于其他场景。本文提出了 UNSEEN,一个通用框架,能够从给定的上限开始估计簇的数量。据我们所知,这是第一个可以轻松与各种深度聚类算法结合的方法。我们通过将 UNSEEN 与流行的深度聚类算法 DCN、DEC 和 DKM 结合,展示了该方法的可行性,并通过在多个图像和表格数据集上的广泛实验评估验证了其有效性。此外,我们进行了大量的消融实验,以分析该方法,展示了其组件的重要性。代码已公开于:https://github.com/collinleiber/UNSEEN。

关键词

引用

@article{arxiv.2410.09491,
  title  = {Dying Clusters Is All You Need -- Deep Clustering With an Unknown Number of Clusters},
  author = {Collin Leiber and Niklas Strauß and Matthias Schubert and Thomas Seidl},
  journal= {arXiv preprint arXiv:2410.09491},
  year   = {2024}
}

备注

Acceppted at the Sixth ICDM Workshop on Deep Learning and Clustering