BanditPAM++:更快的 $k$-medoids 聚类
机器学习
2023-10-31 v1 人工智能
摘要
聚类是数据科学中的基础任务,应用广泛。在 -medoids 聚类中,簇中心必须是实际数据点,且可使用任意距离度量;这些特征分别使得 -medoids 聚类中的簇中心更具可解释性,以及能够对异质对象进行聚类。由于发现了更高效的 -medoids 算法,-medoids 聚类近来日益流行。特别地,近期研究提出了 BanditPAM,一种具有最先进复杂度和聚类精度的随机化 -medoids 算法。在本文中,我们提出 BanditPAM++,它通过两项算法改进加速 BanditPAM,其复杂度比 BanditPAM 快 ,且实际运行时间远快于 BanditPAM。首先,我们证明 BanditPAM 具有特殊结构,允许在每次迭代内部复用聚类信息。其次,我们证明 BanditPAM 具有额外结构,允许在不同迭代之间复用信息。这些观察启发了我们提出的算法 BanditPAM++,其返回与 BanditPAM 相同的聚类结果但通常快数倍。例如,在 CIFAR10 数据集上,BanditPAM++ 返回与 BanditPAM 相同的结果但运行速度快 10 以上。最后,我们提供了 BanditPAM++ 的高性能 C++ 实现,可从 Python 和 R 调用,相关代码见 https://github.com/motiwari/BanditPAM,从业者或可感兴趣。通过单行脚本复现我们所有实验的辅助代码见 https://github.com/ThrunGroup/BanditPAM_plusplus_experiments。
引用
@article{arxiv.2310.18844,
title = {BanditPAM++: Faster $k$-medoids Clustering},
author = {Mo Tiwari and Ryan Kang and Donghyun Lee and Sebastian Thrun and Chris Piech and Ilan Shomorony and Martin Jinye Zhang},
journal= {arXiv preprint arXiv:2310.18844},
year = {2023}
}
备注
NeurIPS 2023