中文

聚类算法及其评估的系统化选择综述

机器学习 2021-06-25 v1

摘要

数据分析在工业创造价值中扮演着不可或缺的角色。在此背景下的聚类分析能够在极少或没有先验知识的情况下探索给定数据集并识别未知模式。随着(大)数据在体量、多样性和速度维度上的复杂性增加,这一点变得更为重要。早期已开发出许多聚类分析工具,且不同聚类算法的种类极为繁多。由于正确聚类程序的选择对数据分析结果至关重要,用户在其从原始数据中提取知识的过程中需要支持。因此,本文的目标在于识别一种用于聚类算法及相应验证概念的系统性选择逻辑。目标是使潜在用户能够选择最适合其需求及底层数据聚类问题属性的算法。此外,支持用户选择恰当的验证概念以理解聚类结果。基于全面的文献综述,本文提供了用于聚类方法评估和验证概念选择的评判标准。这些标准被应用于若干常见算法,并通过引入考虑底层数据结构的基于伪代码的例程来支持算法的选择过程。

关键词

引用

@article{arxiv.2106.12792,
  title  = {A review of systematic selection of clustering algorithms and their evaluation},
  author = {Marc Wegmann and Domenique Zipperling and Jonas Hillenbrand and Jürgen Fleischer},
  journal= {arXiv preprint arXiv:2106.12792},
  year   = {2021}
}

备注

for an interactive version visit https://jhillenbrand.github.io/cluster_table.html