中文

尖峰协方差矩阵主成分的统计推断

统计理论 2020-09-04 v2 统计理论

摘要

本文研究了高维尖峰样本协方差矩阵极端特征值和特征向量在超临界情形(此时可可靠检测尖峰)下的渐近行为。特别地,我们推导了极端特征值与相应特征向量的广义分量(即特征向量在任意给定方向上的投影)的联合分布,假设维度与样本量相当大。一般而言,该联合分布由有限个高斯变量和卡方变量的线性组合给出,其参数依赖于投影方向和尖峰。我们对尖峰的假设是完全一般的。首先,尖峰强度仅要求略高于临界阈值,且不需要强度的上界。其次,允许多重尖峰,即具有相同强度的尖峰。第三,不对尖峰施加结构假设。得益于这一一般设定,我们可以将结果应用于涉及特征值和特征向量的各种高维统计假设检验问题。具体而言,我们提出了准确且有力的统计量来对主成分进行假设检验。这些统计量依赖于数据,并自适应于潜在的真实尖峰。数值模拟也证实了我们所提统计量的准确性和有力性,并显示出相对于文献中现有方法的显著更优性能。特别地,即使尖峰较小或维度较大,我们的方法依然准确且有力。

关键词

引用

@article{arxiv.2008.11903,
  title  = {Statistical inference for principal components of spiked covariance matrices},
  author = {Zhigang Bao and Xiucai Ding and Jingming Wang and Ke Wang},
  journal= {arXiv preprint arXiv:2008.11903},
  year   = {2020}
}

备注

This work largely extends our previous work arXiv:1907.12251, and the latter shall be regarded as a very special case of the current work. In addition, various statistical applications are discussed