分类大数据的快速聚类
机器学习
2025-02-18 v2 数据库
摘要
K-Modes算法是用于聚类分类数据的算法,具备高度算法简单性,但在聚类质量和聚类效率方面表现不可靠,这两者都严重受初始聚类中心选择的影响。在本文中,我们检验了Bisecting K-Modes(BK-Modes)——一种通过 successive bisecting过程寻找聚类的方法——其选取的聚类中心作为K-Modes初始中心的优劣。BK-Modes通过在每个迭代中选择一个聚类并将其二分为两个聚类来工作,将数据集逐步划分为多个聚类。我们以数据到其聚类中心距离之和作为选择指标,以选择每个迭代中要被二分的聚类。该迭代过程在得到K个聚类后停止。然后将这些K个聚类的中心用作K-Modes的初始聚类中心。对BK-Modes进行实验研究,并与K-Modes使用多个初始聚类中心的不同方法以及我们所发现的最先进方法进行比较。实验结果表明,BK-Modes在大数据集的聚类质量和效率方面表现良好。
引用
@article{arxiv.2502.07081,
title = {Fast Clustering of Categorical Big Data},
author = {Bipana Thapaliya and Yu Zhuang},
journal= {arXiv preprint arXiv:2502.07081},
year = {2025}
}
备注
12 pages, 3 figures