中文

用于识别含噪聚类的k近邻图的最优构造

机器学习 2009-12-18 v1 统计理论 统计理论

摘要

我们研究基于数据点随机样本上的邻域图的聚类算法。我们提出的问题是,为了获得最优的聚类结果,应如何构造这样的图。应该选择哪种类型的邻域图:互k近邻图还是对称k近邻图?最优参数k是多少?在我们的设定中,聚类被定义为底层概率分布的t-水平集的连通分量。如果图中的连通分量对应于真实的底层聚类,则称聚类在邻域图中被识别。利用随机几何图论的技术,我们证明了在无噪声和有噪声两种情况下聚类被成功识别的概率界限。这些界限得出了几个结论。首先,为了最大化聚类识别的概率,k必须选择得相当高(数量级为n而非log n)。其次,互k近邻图与对称k近邻图之间的主要差异出现在仅尝试检测最显著聚类时。

关键词

引用

@article{arxiv.0912.3408,
  title  = {Optimal construction of k-nearest neighbor graphs for identifying noisy clusters},
  author = {Markus Maier and Matthias Hein and Ulrike von Luxburg},
  journal= {arXiv preprint arXiv:0912.3408},
  year   = {2009}
}

备注

31 pages, 2 figures