中文

持续性多尺度密度聚类

机器学习 2026-02-03 v2

摘要

聚类是现代数据分析的基石。在探索性数据分析(EDA)中检测聚类需要算法对数据做出很少的假设。基于密度的聚类算法特别适合EDA,因为它们描述高密度区域,仅假设密度存在。然而,在实践中应用基于密度的聚类算法需要选择合适的超参数,而在缺乏数据分布先验知识的情况下这很困难。例如,DBSCAN需要选择密度阈值,而HDBSCAN*依赖于最小聚类规模参数。在本工作中,我们提出了面向噪声应用的持续性叶子空间聚类(PLSCAN)。这一新型基于密度的聚类算法能够高效地识别HDBSCAN*产生稳定(叶子)聚类的所有最小聚类规模。PLSCAN应用尺度空间聚类原理,并等价于在一个新颖度量空间上的持续同调。我们在多个真实数据集上将其性能与HDBSCAN*进行了对比,结果表明它实现了更高的平均ARI,并且对互达邻域数量的变化不那么敏感。此外,我们将PLSCAN的计算成本与k-Means进行了对比,证明其在低维数据集上具有竞争力的运行时间。在更高维度下,运行时间的增长方式与HDBSCAN*更为相似。

关键词

引用

@article{arxiv.2512.16558,
  title  = {Persistent Multiscale Density-based Clustering},
  author = {Daniël Bot and Leland McInnes and Jan Aerts},
  journal= {arXiv preprint arXiv:2512.16558},
  year   = {2026}
}

备注

21 pages, 11 figures, submitted to IEEE Transactions on Knowledge and Data Engineering