中文

VDPC:变密度峰值聚类算法

机器学习 2022-01-04 v1 人工智能

摘要

广泛应用的密度峰值聚类(DPC)算法做出了一种直观的聚类形成假设,即簇中心通常被局部密度较低的数据点包围,且远离其他局部密度较高的数据点。然而,该假设存在一个局限:在识别密度较低的簇时往往存在问题,因为它们可能轻易被并入密度较高的其他簇中。因此,DPC可能无法识别具有变密度的簇。为解决此问题,我们提出了一种变密度峰值聚类(VDPC)算法,旨在对具有各类密度分布的数据集系统且自主地执行聚类任务。具体而言,我们首先提出一种新方法以识别所有数据点中的代表点,并基于所识别的代表点构建初始簇,以进一步分析簇的属性。此外,我们根据局部密度将所有数据点划分为不同层级,并通过结合DPC与DBSCAN两者的优势提出一个统一的聚类框架。由此,分布在不同密度层级上的所有已识别初始簇被系统地处理以形成最终簇。为评估所提VDPC算法的有效性,我们使用20个数据集(包括8个合成数据集、6个真实世界数据集和6个图像数据集)进行了大量实验。实验结果表明,VDPC优于两种经典算法(即DPC和DBSCAN)以及四种最先进的扩展DPC算法。

关键词

引用

@article{arxiv.2201.00641,
  title  = {VDPC: Variational Density Peak Clustering Algorithm},
  author = {Yizhang Wang and Di Wang and You Zhou and Xiaofeng Zhang and Chai Quek},
  journal= {arXiv preprint arXiv:2201.00641},
  year   = {2022}
}