中文

谱聚类方法中相似矩阵的构造:数值实验

数值分析 2019-04-26 v1 机器学习

摘要

谱聚类是一种通过相似矩阵的特征向量来发现数据集中结构的强有力方法。当各个簇的结构高度非凸时,它通常优于 kk-means 等传统聚类算法。其精度取决于如何定义数据点对的相似度。两个重要因素影响着相似矩阵的构造:底层加权图的稀疏性(主要取决于数据点间的距离)和相似度函数。当使用高斯相似度函数时,尺度参数 σ\sigma 的选择可能至关重要。在本文中,我们基于直接与数据集相关联的图或图的最小生成树(MST),考察了稀疏性以及合适 σ\sigma 的选择这两个因素。我们在人工和真实世界数据集上进行了广泛的数值实验,以比较各方法的性能。

关键词

引用

@article{arxiv.1904.11352,
  title  = {Construction of the similarity matrix for the spectral clustering method: numerical experiments},
  author = {Paola Favati and Grazia Lotti and Ornella Menchi and Francesco Romani},
  journal= {arXiv preprint arXiv:1904.11352},
  year   = {2019}
}

备注

Submitted to Journal of Computational and Applied Mathematics