中文

面向层次聚类的聚合数据

机器学习 2023-09-07 v1 数据库 机器学习

摘要

层次凝聚聚类(HAC)可能是最早且最灵活的聚类方法,因为它可与许多距离、相似度以及各种链接策略配合使用。当数据集所形成的簇数量未知且数据中可能存在某种层次结构时,它常被使用。大多数 HAC 算法在全距离矩阵上运行,因此需要二次方内存。标准算法生成完整层次结构还具有三次方运行时间。内存和运行时间问题在嵌入式或其他资源极度受限的系统中尤为突出。在本节中,我们展示了如何使用 BETULA(知名 BIRCH 数据聚合算法的数值稳定版本)进行数据聚合,以使 HAC 在资源受限的系统上可行,且仅造成聚类质量的微小损失,从而允许对极大型数据集进行探索性数据分析。

关键词

引用

@article{arxiv.2309.02552,
  title  = {Data Aggregation for Hierarchical Clustering},
  author = {Erich Schubert and Andreas Lang},
  journal= {arXiv preprint arXiv:2309.02552},
  year   = {2023}
}