中文

基于互近邻的层次聚类方法

信息检索 2021-02-24 v1 社会与信息网络 数据分析、统计与概率

摘要

聚类是一种基础的分析工具,旨在根据数据点的相似度或距离将其分类为若干组。它已在包括生物学、物理学、经济学、化学、天文学、心理学等在内的所有自然科学与社会科学中获得了成功应用。在众多现有算法中,层次聚类算法具有独特优势,因为它们能在无需预先确定簇数的情况下提供不同分辨率的结果,并展现所得簇的组织结构。与此同时,它们也存在多种缺陷,因此要么耗时要么不准确。我们基于一个简单的假设——两个互近邻数据点应被归入同一簇——提出了一种新颖的层次聚类方法。跨多个领域数据集的广泛测试表明,我们的方法比最先进的基准方法更快且更准确。我们进一步扩展该方法以处理真实网络中的社区发现问题,与著名的 Girvan-Newman 算法相比取得了显著更好的结果。

关键词

引用

@article{arxiv.1907.04915,
  title  = {Hierarchical Clustering Supported by Reciprocal Nearest Neighbors},
  author = {Wen-Bo Xie and Yan-Li Lee and Cong Wang and Duan-Bing Chen and Tao Zhou},
  journal= {arXiv preprint arXiv:1907.04915},
  year   = {2021}
}

备注

13 pages, 5 figures, 5 supplementary figures, 2 tables