Chameleon2++:Chameleon 聚类的高效可扩展变体
机器学习
2025-10-07 v2 数据结构与算法
摘要
层次聚类仍然是数据挖掘中的一个基本挑战,特别是在处理传统方法难以有效扩展的大规模数据集时。近期基于 Chameleon 的算法——Chameleon2、M-Chameleon 和 INNGS-Chameleon 提出了先进的策略,但它们仍然存在 的计算复杂度问题,对于大型数据集尤为明显。以 Chameleon2 作为基础算法,我们引入了 Chameleon2++ 来应对这一挑战。我们的算法包含三个部分。第一,图生成——我们提出使用近似 -NN 搜索代替精确搜索,具体而言,我们集成了 Annoy 算法。这实现了快速的近似最近邻计算,显著减少了图生成时间。第二,图划分——我们提出使用多层次划分算法代替递归二分算法。具体而言,我们采用 hMETIS 算法代替 FM。这是因为多层次算法对图生成阶段引入的近似具有鲁棒性,能够产生质量更高的划分,且所需配置最少。第三,合并——我们保留了 flood fill 启发式方法,以确保划分中连通平衡的组件,以及高效的划分合并标准,从而得到最终的簇。这些增强将整体时间复杂度降低至 ,实现了可扩展性。在先前 Chameleon 工作中使用的真实基准数据集上,Chameleon2++ 在聚类质量上平均提升了 4%。这证明了算法效率和聚类质量在大规模层次聚类中可以共存。
关键词
引用
@article{arxiv.2501.02612,
title = {Chameleon2++: An Efficient and Scalable Variant Of Chameleon Clustering},
author = {Priyanshu Singh and Kapil Ahuja},
journal= {arXiv preprint arXiv:2501.02612},
year = {2025}
}
备注
10 Pages, 2 Figures, 5 Tables