基于鲸鱼优化算法的可扩展 k-Medoids 聚类
机器学习
2025-06-03 v2 性能
摘要
无监督聚类已成为在海量无标签数据集中发现隐藏模式的关键工具。然而,传统方法,例如围绕中心点划分(PAM),由于其二次计算复杂度而在可扩展性方面存在困难。为了解决这一限制,我们引入了 WOA-kMedoids,一种结合了鲸鱼优化算法(WOA)的新型无监督聚类方法,这是一种受座头鲸狩猎策略启发的自然启发式元启发式算法。通过优化中心点选择,WOA-kMedoids 将计算复杂度从相对于观测数量的二次复杂度降低到近线性复杂度,从而实现了向大型数据集的可扩展性,同时保持了高聚类精度。我们使用来自 UCR 档案库的 25 个不同的时间序列数据集对 WOA-kMedoids 进行了评估。我们的实证结果表明,WOA-kMedoids 取得了与 PAM 相当的聚类性能,其平均 Rand Index(RI)为 0.731,而 PAM 为 0.739,在 25 个数据集中的 12 个上优于 PAM。虽然在小型数据集(<300 个观测值)上表现出比 PAM 略高的运行时间,但 WOA-kMedoids 在更大数据集上优于 PAM,平均加速比为 1.7 倍,最高为 2.3 倍。WOA-kMedoids 的可扩展性结合其高精度,使其成为大数据应用中无监督聚类的有前途的选择。该方法对海量无标签数据集中的高效知识发现具有重要意义,特别是在传统 k-medoids 方法在计算上不可行的情况下,包括物联网异常检测、生物医学信号分析和客户行为聚类。
引用
@article{arxiv.2408.16993,
title = {A Scalable k-Medoids Clustering via Whale Optimization Algorithm},
author = {Huang Chenan and Narumasa Tsutsumida},
journal= {arXiv preprint arXiv:2408.16993},
year = {2025}
}
备注
19 pages, 7 figures