基于马氏距离的不完整数据 K-Means 聚类
机器学习
2025-04-14 v2
摘要
将 K-Means 算法有效应用于具有不完整特征的聚类任务,因其对现实应用的影响,仍是一个重要研究领域。近期研究表明,将 K-Means 聚类与填补统一为单一目标函数并求解由此产生的优化问题,其效果优于分别处理填补和聚类。本文通过开发一种融合马氏距离的统一 K-Means 算法(而非传统的欧氏距离)扩展了这一方法,此前研究已表明马氏距离对椭圆形簇效果更好。我们在包含多达十个椭圆簇的合成数据集以及 IRIS 数据集上进行了大量实验。使用调整兰德指数(ARI)和归一化互信息(NMI),我们证明了该算法在 IRIS 数据集和具有椭圆簇的随机生成数据上,均持续优于先填补后 K-Means(无论使用马氏距离还是欧氏距离)以及用于处理不完整数据的近期整合填补与聚类的 K-Means 算法。
引用
@article{arxiv.2411.00870,
title = {K-Means Clustering With Incomplete Data with the Use of Mahalanobis Distances},
author = {Lovis Kwasi Armah and Igor Melnykov},
journal= {arXiv preprint arXiv:2411.00870},
year = {2025}
}