中文

更快的 k-Medoids 聚类:改进 PAM、CLARA 与 CLARANS 算法

机器学习 2024-07-08 v4 机器学习

摘要

对非欧几里得数据进行聚类是困难的,除层次聚类外,最常用的算法之一是广受欢迎的围绕中心点的划分(PAM)算法,也简称为 k-medoids。在欧几里得几何中,均值(如 k-means 中所用)是簇中心的一个良好估计量,但这对任意相异度并不成立。PAM 改用中心点(medoid),即簇中与所有其他对象相异度最小的对象。这种中心性概念可用于任何(不)相似度,因此对相关领域(如需要使用 Jaccard、Gower 或更复杂距离的生物学的许多领域)具有高度相关性。PAM 的一个关键问题是其较高的运行时间成本。我们提出对 PAM 算法的修改,以在算法的第二阶段 SWAP 中实现 O(k) 倍的加速,但仍将找到与原始 PAM 算法相同的结果。如果我们稍微放宽所执行交换的选择(在质量相当的情况下),我们可以通过在每次迭代中执行最多 k 次交换来进一步加速算法。借助显著更快的 SWAP,我们现在也可以探索选择初始中心点的替代策略。我们还展示了 CLARA 和 CLARANS 算法如何从这些修改中受益。它可以轻松地与早期在大数据上使用 PAM 和 CLARA 的方法结合(其中一些以 PAM 为子程序,因此可立即从这些改进中受益),其中高 k 下的性能变得越来越重要。在 k=100 的真实数据实验中,我们观察到相较于原始 PAM SWAP 算法有 200 倍的加速,使得只要能够负担计算距离矩阵,PAM 就适用于更大的数据集,特别是更高的 k(在 k=2 时,新的 SWAP 仅快 1.5 倍,因为加速预期随 k 增大而增加)。

关键词

引用

@article{arxiv.1810.05691,
  title  = {Faster k-Medoids Clustering: Improving the PAM, CLARA, and CLARANS Algorithms},
  author = {Erich Schubert and Peter J. Rousseeuw},
  journal= {arXiv preprint arXiv:1810.05691},
  year   = {2024}
}