PCA 与谱聚类的 $\ell_p$ 理论
统计理论
2022-04-12 v3 机器学习
概率论
机器学习
统计理论
摘要
主成分分析(PCA)是统计学和机器学习中的有力工具。虽然现有对 PCA 的研究集中于主成分及其相关特征值的恢复,但针对样本低维嵌入的个体主成分得分的精确刻画很少,这阻碍了各种谱方法的分析。在本文中,我们首先在希尔伯特空间中发展了去心版 PCA 的 扰动理论,该理论在存在异方差噪声时证明优于原始 PCA。通过对特征向量的新颖 分析,我们研究了主成分得分向量的逐项行为,并表明它们可以在 范数下由 Gram 矩阵的线性泛函近似,其中包括 和 作为特例。对于亚高斯混合模型,给出最优界限的 的选择取决于信噪比,这进一步为谱聚类提供了最优性保证。对于上下文社区检测, 理论导出了一种简单的谱算法,该算法达到了精确恢复的信息阈值。这些也作为特例为高斯混合模型和随机块模型提供了最优恢复结果。
引用
@article{arxiv.2006.14062,
title = {An $\ell_p$ theory of PCA and spectral clustering},
author = {Emmanuel Abbe and Jianqing Fan and Kaizheng Wang},
journal= {arXiv preprint arXiv:2006.14062},
year = {2022}
}
备注
72 pages, 2 figures