中文

广义尖峰总体模型下主成分分析与收缩偏差调整的渐近性质

统计理论 2019-03-11 v1 机器学习 统计理论

摘要

随着高通量技术的发展,高维情形下的主成分分析(PCA)备受关注。大多数现有的高维PCA理论和方法论结果基于尖峰总体模型,其中除少数大特征值外所有总体特征值均相等。然而,由于特征间局部相关性的存在,该假设在许多真实数据集中可能不成立。为解决此问题,我们研究了广义尖峰总体模型下PCA的渐近行为。基于理论结果,我们提出了一系列方法,用于总体特征值的一致估计、样本与总体特征向量间夹角、样本与总体主成分(PC)得分间的相关系数,以及预测PC得分的收缩偏差调整。利用数值实验和来自遗传学文献的真实数据示例,我们表明我们的方法能大幅减少偏差并提高预测精度。

关键词

引用

@article{arxiv.1607.08647,
  title  = {Asymptotic properties of Principal Component Analysis and shrinkage-bias adjustment under the Generalized Spiked Population model},
  author = {Rounak Dey and Seunggeun Lee},
  journal= {arXiv preprint arXiv:1607.08647},
  year   = {2019}
}