中文

Chameleon2++:Chameleon 聚类的高效可扩展变体

机器学习 2025-10-07 v2 数据结构与算法

摘要

层次聚类仍然是数据挖掘中的一个基本挑战,特别是在处理传统方法难以有效扩展的大规模数据集时。近期基于 Chameleon 的算法——Chameleon2、M-Chameleon 和 INNGS-Chameleon 提出了先进的策略,但它们仍然存在 O(n2)O(n^2) 的计算复杂度问题,对于大型数据集尤为明显。以 Chameleon2 作为基础算法,我们引入了 Chameleon2++ 来应对这一挑战。我们的算法包含三个部分。第一,图生成——我们提出使用近似 kk-NN 搜索代替精确搜索,具体而言,我们集成了 Annoy 算法。这实现了快速的近似最近邻计算,显著减少了图生成时间。第二,图划分——我们提出使用多层次划分算法代替递归二分算法。具体而言,我们采用 hMETIS 算法代替 FM。这是因为多层次算法对图生成阶段引入的近似具有鲁棒性,能够产生质量更高的划分,且所需配置最少。第三,合并——我们保留了 flood fill 启发式方法,以确保划分中连通平衡的组件,以及高效的划分合并标准,从而得到最终的簇。这些增强将整体时间复杂度降低至 O(nlogn)O(n\log n),实现了可扩展性。在先前 Chameleon 工作中使用的真实基准数据集上,Chameleon2++ 在聚类质量上平均提升了 4%。这证明了算法效率和聚类质量在大规模层次聚类中可以共存。

关键词

引用

@article{arxiv.2501.02612,
  title  = {Chameleon2++: An Efficient and Scalable Variant Of Chameleon Clustering},
  author = {Priyanshu Singh and Kapil Ahuja},
  journal= {arXiv preprint arXiv:2501.02612},
  year   = {2025}
}

备注

10 Pages, 2 Figures, 5 Tables