快速且急切的 k-Medoids 聚类:PAM、CLARA 与 CLARANS 算法的 O(k) 级运行时改进
机器学习
2024-07-08 v2 人工智能
机器学习
摘要
对非欧几里得数据进行聚类是困难的,除层次聚类外,最常用的算法之一是广受欢迎的围绕中心点的划分(PAM)算法,也简称为 k-medoids 聚类。在欧几里得几何中,k-means 所使用的均值可作为聚类中心的良好估计,但对于任意相异度而言均值并不存在。PAM 改用中心点(medoid),即簇内与其他所有对象相异度之和最小的对象。这种中心性概念可用于任何(不)相似度,因此对许多领域和应用具有高度相关性。PAM 的一个关键问题是其高昂的运行时开销。我们对 PAM 算法提出改进,在算法的第二阶段(“SWAP”)实现 O(k) 倍的加速,同时仍能找到与原始 PAM 算法相同的结果。如果我们放宽所执行交换的选择(同时保持可比的质量),则可通过在每次迭代中急切地执行额外交换来进一步加速算法。借助大幅更快的 SWAP,我们现在可以探索更快的初始化策略,因为(i)经典的(“BUILD”)初始化成为瓶颈,且(ii)我们的交换足够快以补偿更差的起始条件。我们还展示了 CLARA 和 CLARANS 算法如何从所提出的改进中受益。虽然我们在本工作中未研究我们方法的并行化,但它可以轻松地与早期方法结合以在大数据上使用 PAM 和 CLARA(其中一些以 PAM 为子例程,因此可立即从这些改进中受益),而在高 k 下性能变得愈发重要。在 k=100、200 的真实数据实验中,我们观察到相较于原始 PAM SWAP 算法分别有 458 倍和 1191 倍的加速,使 PAM 可应用于更大数据集,尤其是更高的 k。
引用
@article{arxiv.2008.05171,
title = {Fast and Eager k-Medoids Clustering: O(k) Runtime Improvement of the PAM, CLARA, and CLARANS Algorithms},
author = {Erich Schubert and Peter J. Rousseeuw},
journal= {arXiv preprint arXiv:2008.05171},
year = {2024}
}