PCA 的最优性与次最优性 I:尖峰随机矩阵模型
统计理论
2018-08-29 v2 数据结构与算法
信息论
math.IT
概率论
机器学习
统计理论
摘要
随机矩阵理论的一个核心问题是理解尖峰随机矩阵模型(由 Johnstone 引入)的特征值,其中将一个显著的特征向量(或“尖峰”)植入随机矩阵中。这些分布在各科学的 principal component analysis(PCA,主成分分析)问题中构成了自然的统计模型。Baik、Ben Arous 和 Peche 证明了尖峰 Wishart 系综渐近地展现出尖锐的相变:当尖峰强度高于临界阈值时,可基于最大特征值检测尖峰的存在,而低于阈值时最大特征值不提供任何信息。此类结果构成了我们对 PCA 在噪声存在下何时能检测低秩信号这一理解的基础。然而,在对尖峰施加结构假设时,并非所有信息都必然包含在谱中。我们研究用于检测尖峰存在的检验的统计极限,包括非谱检验。我们的结果利用了 Le Cam 的邻近性概念,并包括:i) 对高斯 Wigner 系综,我们证明对某些自然的尖峰先验,PCA 达到了最优检测阈值。ii) 对任意非高斯 Wigner 系综,PCA 在检测上是次最优的。然而,通过对矩阵元素进行预变换,PCA 的一个高效变体达到了(对自然先验的)最优阈值。iii) 对高斯 Wishart 系综,PCA 阈值对正尖峰是最优的(对自然先验),但对负尖峰并非总是如此。
引用
@article{arxiv.1807.00891,
title = {Optimality and Sub-optimality of PCA I: Spiked Random Matrix Models},
author = {Amelia Perry and Alexander S. Wein and Afonso S. Bandeira and Ankur Moitra},
journal= {arXiv preprint arXiv:1807.00891},
year = {2018}
}
备注
67 pages, 3 figures. This is the journal version of part I of arXiv:1609.05573, accepted to the Annals of Statistics. This version includes the supplementary material as appendices