概率度量空间中的随机范数k均值:聚类中的范式转变
机器学习
2025-04-08 v1 概率论
机器学习
摘要
现有方法仍大多受限于传统距离度量,难以有效处理随机数据。本文首次提出一种基于概率度量空间的k均值变体,用良定义的距离分布函数取代常规距离度量。这种开创性方法在确定性和随机数据集上实现更灵活且稳健的聚类,为随机环境下的聚类建立新理论基础。通过概率视角,本方法不仅引入新范式,还构建严谨理论框架,预计将成为涉及随机数据的聚类研究的关键参考。对多样化真实与合成数据集进行大规模实验,使用Silhouette、Davies-Bouldin、Calinski-Harabasz、调整Rand指数和失真等广泛认可的评估指标评估模型效果。与k-means++、模糊c均值和核概率k均值等经典方法比较,证明所提随机范数k均值(RNKM)算法具有优越性能。值得注意的是,RNKM展现出识别非线性可分离结构的惊人能力,在复杂聚类场景中表现突出。上述发现将RNKM定位为聚类研究的突破性进展,为传统技术提供了强有力替代方案,同时解决了文献中长期存在的空白。通过将概率度量与聚类相结合,本研究为后续发展提供了基础性参考,为向更先进的数据分析开辟新方向,尤其适用于动态数据驱动应用
引用
@article{arxiv.2504.03928,
title = {Random Normed k-Means: A Paradigm-Shift in Clustering within Probabilistic Metric Spaces},
author = {Abderrafik Laakel Hemdanou and Youssef Achtoun and Mohammed Lamarti Sefian and Ismail Tahiri and Abdellatif El Afia},
journal= {arXiv preprint arXiv:2504.03928},
year = {2025}
}
备注
27 pages, 16 figures