中文

kFuse: 一种基于密度的凝聚聚类方法

计算机视觉与模式识别 2025-05-12 v1

摘要

凝聚聚类因其直观灵活的特性已成为数据分析中的重要工具。然而,现有的凝聚聚类方法通常涉及子簇划分和簇间相似性评估的额外参数。这需要在不同数据集上进行不同的参数设置,而在缺乏先验知识的情况下无疑具有挑战性。此外,现有的凝聚聚类技术受限于连接距离的计算方法,导致聚类结果不稳定。为了解决这些问题,本文提出了一种新的基于密度的凝聚聚类方法,称为 kFuse。kFuse 包含四个关键组成部分:(1) 基于自然邻居的子簇划分;(2) 通过计算相邻样本和最短距离确定子簇之间的边界连通性;(3) 通过计算平均密度和方差评估子簇之间的密度相似性;以及 (4) 基于边界连通性和密度相似性建立子簇之间的合并规则。kFuse 仅在最终合并阶段指定簇的数量。此外,通过全面考虑不同子簇之间的相邻样本、距离和密度,kFuse 在合并阶段显著提高了准确性,从而大大增强了其识别能力。在合成和真实数据集上的实验结果验证了 kFuse 的有效性。

关键词

引用

@article{arxiv.2505.05748,
  title  = {kFuse: A novel density based agglomerative clustering},
  author = {Huan Yan and Junjie Hu},
  journal= {arXiv preprint arXiv:2505.05748},
  year   = {2025}
}

备注

13 pages, 11 figures