超越标签:以距离分布熵(EDD)推进聚类分析
机器学习
2023-11-29 v1 机器学习
摘要
在不断发展中的数据科学领域,高维数据集中聚类现象的准确量化仍是一项重大挑战,尤其在缺乏预定义标签时。本文引入一种新方法——距离分布熵(EDD),它代表了无标签聚类分析的范式转变。依赖离散标签的传统方法常难以辨识无标签数据中的复杂聚类模式。而 EDD 利用点对点成对距离的特征差异来辨识聚类趋势,与数据标签无关。我们的方法采用香农信息熵来量化数据集中距离分布的“峰度”或“平坦度”。该熵度量相对于其最大值归一化后,能有效区分强聚类数据(由距离分布中的显著峰值指示)与更同质、非聚类的数据集。这种无标签量化对数据点的全局平移和置换具有鲁棒性,且通过额外的按维度 z 标准化,其变为对数据集缩放不变。我们通过一系列涉及具有高斯聚类中心的二维数据空间的实验证明 EDD 的有效性。我们的发现揭示,随着聚类宽度从良好分离向重叠聚类扩大,EDD 值单调增加。该行为凸显了该方法在检测不同聚类程度时的敏感性与准确性。EDD 的潜力超越常规聚类分析,提供了一种鲁棒、可扩展的工具,用于在不依赖预先分配标签的情况下揭示复杂数据结构。
引用
@article{arxiv.2311.16621,
title = {Beyond Labels: Advancing Cluster Analysis with the Entropy of Distance Distribution (EDD)},
author = {Claus Metzner and Achim Schilling and Patrick Krauss},
journal= {arXiv preprint arXiv:2311.16621},
year = {2023}
}