中文

改进的聚类谱范数界

机器学习 2012-06-18 v2 数据结构与算法

摘要

旨在统一关于分离条件下分布混合体聚类的已知结果,Kumar 和 Kannan [2010] 引入了一种用于数据集聚类的确定性条件。他们表明,这一单一的确定性条件涵盖了许多先前研究过的聚类假设。具体而言,他们的邻近条件要求:在目标 kk-聚类中,点 xx 在其聚类中心 μ\mu 与另一中心 μ\mu' 连线上的投影,距离 μ\mu 比距离 μ\mu' 近一个较大的加法因子。该加法因子大致可描述为 kk 乘以代表给定(已知)数据集与(未知)目标聚类均值之间差异矩阵的谱范数。显然,邻近条件蕴含了中心分离——任意两个中心之间的距离必须至少达到上述界限。本文在多个方面改进了 Kumar 和 Kannan 的工作。首先,我们将中心分离界限放宽了 k\sqrt{k} 倍;其次,我们将邻近条件放宽了 kk 倍。利用这些较弱的界限,当所有点均满足邻近条件时,我们仍能获得相同的保证。此外,当仅有 (1ϵ)(1-\epsilon) 比例的点满足较弱的邻近条件时,我们也获得了更好的保证。我们分析的主体仅依赖于中心分离,在此条件下可产生一种聚类,其具有:(i) 低误差,(ii) 低 kk-means 代价,以及 (iii) 非常接近目标中心的聚类中心。我们改进的分离条件使我们能够匹配 McSherry [2001] 的植入划分模型的结果,改进 Ostrovsky 等人 [2006] 的结果,并在特定设定下改进高斯混合模型的分离结果。

关键词

引用

@article{arxiv.1206.3204,
  title  = {Improved Spectral-Norm Bounds for Clustering},
  author = {Pranjal Awasthi and Or Sheffet},
  journal= {arXiv preprint arXiv:1206.3204},
  year   = {2012}
}