中文

聚类和子矩阵数量增长时植入问题与子矩阵定位中的统计-计算权衡

机器学习 2015-03-16 v3 统计理论 统计理论

摘要

我们考虑两个密切相关的问题:植入聚类和子矩阵定位。植入聚类问题假设随机图是基于节点的一些潜在聚类生成的;任务是在给定图的情况下恢复这些聚类。子矩阵定位问题涉及在一个大的实值随机矩阵中定位具有升高均值的隐藏子矩阵。特别感兴趣的是允许聚类/子矩阵数量随问题规模无界增长的情况。这些公式涵盖了几个经典模型,如植入团、植入最密子图、植入划分、植入着色和随机块模型,这些模型广泛用于研究社区检测和聚类/双聚类。对于这两个问题,我们展示了模型参数(聚类/子矩阵大小、聚类密度和子矩阵均值)的空间可以划分为四个不相交的区域,对应于递减的统计和计算复杂度:(1)不可能区域,所有算法都失败;(2)困难区域,计算昂贵的最大似然估计(MLE)成功;(3)容易区域,多项式时间凸化MLE成功;(4)简单区域,简单的计数/阈值过程成功。此外,我们展示了这些算法中的每一个在前面的更困难区域中都会失败。我们的定理建立了极小极大恢复极限,这些极限在常数范围内是紧的,并且随着聚类/子矩阵数量的增长而成立,并且为多项式时间算法提供了比以前已知的更强的性能保证。我们的研究展示了统计和计算考虑之间的权衡,并表明极小极大恢复极限可能无法通过多项式时间算法实现。

关键词

引用

@article{arxiv.1402.1267,
  title  = {Statistical-Computational Tradeoffs in Planted Problems and Submatrix Localization with a Growing Number of Clusters and Submatrices},
  author = {Yudong Chen and Jiaming Xu},
  journal= {arXiv preprint arXiv:1402.1267},
  year   = {2015}
}

备注

We updated the statements for Theorems 2.1 and 2.3. Partial results appeared at the International Conference on Machine Learning (ICML) 2014