中文

标记随机块模型中的最优簇恢复

概率论 2016-05-24 v6 机器学习 社会与信息网络 机器学习

摘要

我们考虑在标记随机块模型(LSBM)中进行社区检测或聚类的问题,其中具有有限数量KK个簇,其大小随物品总体数量nn线性增长。每对物品独立随机地被打上标签,标签\ell出现在分别属于索引为iijj的簇的两个物品之间的概率为p(i,j,)p(i,j,\ell)。目标是从这些随机标签的观测中重建簇。近期,SBM及其扩展下的聚类引起了大量关注。大多数现有工作旨在刻画参数集合,使得能够推断出与真实簇正相关的簇、或误分类物品比例消失的簇、或完全匹配真实簇的簇。我们找到了这样的参数集合:在一般LSBM下且对任意s=o(n)s=o(n),存在一种平均误分类物品数不超过ss的聚类算法,这解决了\cite{abbe2015community}中提出的一个开放问题。我们进一步开发了一种基于简单谱方法的算法,该算法在O(n\mboxpolylog(n))O(n \mbox{polylog}(n))计算量内且无需模型参数的先验知识下,达到了这一基本性能极限。

关键词

引用

@article{arxiv.1510.05956,
  title  = {Optimal Cluster Recovery in the Labeled Stochastic Block Model},
  author = {Se-Young Yun and Alexandre Proutiere},
  journal= {arXiv preprint arXiv:1510.05956},
  year   = {2016}
}

备注

arXiv admin note: text overlap with arXiv:1412.7335