标记随机块模型中的最优簇恢复
概率论
2016-05-24 v6 机器学习
社会与信息网络
机器学习
摘要
我们考虑在标记随机块模型(LSBM)中进行社区检测或聚类的问题,其中具有有限数量个簇,其大小随物品总体数量线性增长。每对物品独立随机地被打上标签,标签出现在分别属于索引为和的簇的两个物品之间的概率为。目标是从这些随机标签的观测中重建簇。近期,SBM及其扩展下的聚类引起了大量关注。大多数现有工作旨在刻画参数集合,使得能够推断出与真实簇正相关的簇、或误分类物品比例消失的簇、或完全匹配真实簇的簇。我们找到了这样的参数集合:在一般LSBM下且对任意,存在一种平均误分类物品数不超过的聚类算法,这解决了\cite{abbe2015community}中提出的一个开放问题。我们进一步开发了一种基于简单谱方法的算法,该算法在计算量内且无需模型参数的先验知识下,达到了这一基本性能极限。
引用
@article{arxiv.1510.05956,
title = {Optimal Cluster Recovery in the Labeled Stochastic Block Model},
author = {Se-Young Yun and Alexandre Proutiere},
journal= {arXiv preprint arXiv:1510.05956},
year = {2016}
}
备注
arXiv admin note: text overlap with arXiv:1412.7335