中文

PCA 与谱聚类的 $\ell_p$ 理论

统计理论 2022-04-12 v3 机器学习 概率论 机器学习 统计理论

摘要

主成分分析(PCA)是统计学和机器学习中的有力工具。虽然现有对 PCA 的研究集中于主成分及其相关特征值的恢复,但针对样本低维嵌入的个体主成分得分的精确刻画很少,这阻碍了各种谱方法的分析。在本文中,我们首先在希尔伯特空间中发展了去心版 PCA 的 p\ell_p 扰动理论,该理论在存在异方差噪声时证明优于原始 PCA。通过对特征向量的新颖 p\ell_p 分析,我们研究了主成分得分向量的逐项行为,并表明它们可以在 p\ell_p 范数下由 Gram 矩阵的线性泛函近似,其中包括 2\ell_2\ell_\infty 作为特例。对于亚高斯混合模型,给出最优界限的 pp 的选择取决于信噪比,这进一步为谱聚类提供了最优性保证。对于上下文社区检测,p\ell_p 理论导出了一种简单的谱算法,该算法达到了精确恢复的信息阈值。这些也作为特例为高斯混合模型和随机块模型提供了最优恢复结果。

关键词

引用

@article{arxiv.2006.14062,
  title  = {An $\ell_p$ theory of PCA and spectral clustering},
  author = {Emmanuel Abbe and Jianqing Fan and Kaizheng Wang},
  journal= {arXiv preprint arXiv:2006.14062},
  year   = {2022}
}

备注

72 pages, 2 figures