中文

基于子采样因子分析与主成分分析成分数置信区间的估计方法

统计方法学 2022-05-17 v2 统计理论 统计理论

摘要

因子分析(FA)与主成分分析(PCA)是用于概括和解释多变量数据集变异性的常用统计方法。默认情况下,FA 与 PCA 假设成分或因子数事先已知。然而在实践中,用户首先估计因子或成分数,然后利用该点估计执行 FA 与 PCA 分析。因此,在实践中用户忽略了因子或成分点数估计中的任何不确定性。对于该点估计的不确定性不可忽略的数据集,审慎的做法是对因子或成分数的置信区间内的正整数值范围执行 FA 与 PCA 分析。我们针对此问题,提出一种基于子采样的数据密集型方法,用于估计 FA 与 PCA 中成分数的置信区间。我们研究了所提置信区间的覆盖概率,并给出了关于置信区间准确性的非渐近理论保证。作为副产品,我们推导了当数据矩阵在因子模型下生成时样本协方差矩阵尖峰特征值的一阶 Edgeworth 展开。我们还通过数值模拟以及将我们的方法应用于人类基因组多样性计划基因分型数据集的因子数置信区间估计,展示了方法的实用性。

关键词

引用

@article{arxiv.2205.04945,
  title  = {Confidence Intervals for the Number of Components in Factor Analysis and Principal Components Analysis via Subsampling},
  author = {Chetkar Jha and Ian Barnett},
  journal= {arXiv preprint arXiv:2205.04945},
  year   = {2022}
}