使用均衡 K-均值进行不平衡数据聚类
机器学习
2024-06-07 v3 机器学习
摘要
基于质心的聚类算法,如硬 K-均值(HKM)和模糊 K-均值(FKM),一直受限于对大簇的学习偏差。它们的质心往往拥挤在大簇中,当真实的底层数据组大小不一(即不平衡数据)时,性能会受到影响。为解决这一问题,我们提出了一种基于 Boltzmann 算子的新聚类目标函数,引入了一种新颖的质心排斥机制,即质心周围的数据点会排斥其他质心。较大的簇产生更强的排斥力,从而有效缓解了大簇学习偏差问题。所提出的新算法称为均衡 K-均值(EKM),结构简单,在两个步骤间交替进行;节省资源,具有与 FKM 相同的时间和空间复杂度;并且可通过批量学习扩展至大规模数据集。我们在合成数据集和真实世界数据集上对 EKM 的性能进行了大量评估。结果表明,EKM 在平衡数据上表现具有竞争力,在不平衡数据上显著优于基准算法。深度聚类实验表明,在不平衡数据上,EKM 是 HKM 和 FKM 的更好替代方案,因为它能获得更具判别力的表示。此外,我们将 HKM、FKM 和 EKM 重构为梯度下降的通用形式,并展示了这种通用形式如何促进对 K-均值算法的统一研究。
引用
@article{arxiv.2402.14490,
title = {Imbalanced Data Clustering using Equilibrium K-Means},
author = {Yudong He},
journal= {arXiv preprint arXiv:2402.14490},
year = {2024}
}