中文

选择聚类数量、聚类模型与算法:基于二次判别得分的统一方法

机器学习 2023-08-14 v3 机器学习

摘要

聚类分析需要做出许多决策:聚类方法及其隐含的参考模型、聚类数量,以及通常还有若干超参数和算法调优。在实践中,人们会生成多个划分,然后基于验证或选择标准从中选出最终的一个。存在大量的验证方法,它们或隐或显地假设了某种聚类概念。此外,这些方法通常仅限于对从特定方法获得的划分进行操作。本文聚焦于那些可以通过二次或线性边界良好分离的组。参考聚类概念通过二次判别得分函数以及描述聚类大小、中心和散布的参数来定义。我们开发了两个称为二次得分的聚类质量准则。我们证明这些准则与从一般椭圆对称分布类生成的组是一致的。对这种类型组的追求在应用中很常见。我们研究了与混合模型和基于模型的聚类的似然理论之间的联系。基于二次得分的Bootstrap重采样,我们提出了一种选择规则,允许在众多聚类解中进行选择。所提方法具有一个显著优势:它可以比较那些无法用其他最先进方法进行比较的划分。大量的数值实验和真实数据分析表明,即使某些竞争方法在某些设置下表现更优,所提方法也能实现更好的整体性能。

关键词

引用

@article{arxiv.2111.02302,
  title  = {Selecting the number of clusters, clustering models, and algorithms. A unifying approach based on the quadratic discriminant score},
  author = {Luca Coraggio and Pietro Coretto},
  journal= {arXiv preprint arXiv:2111.02302},
  year   = {2023}
}

备注

Supplemental materials are included at the end of the paper