中文

高维异方差数据的最优加权 PCA

统计理论 2022-09-14 v4 统计理论

摘要

现代数据日益呈现高维且异方差的特征。本文考虑了从样本间异方差(即某些样本比其他样本噪声更大)的高维数据中估计潜在主成分的挑战。这种异方差自然产生,例如当合并来自不同来源或传感器的数据时。解释这种异方差的一种自然方式是通过使用加权样本协方差矩阵的前导特征向量,在 PCA 中给噪声较大的样本块更小权重。我们考虑选择权重以最优恢复潜在成分的问题。一般而言,人们无法知道这些最优权重,因为它们依赖于我们试图估计的潜在成分。然而,我们表明在一些自然的统计假设下,对于高维数据,最优权重收敛于信号和噪声方差的一个简单函数。令人惊讶的是,最优权重并非实践中常用的逆噪声方差权重。我们通过数值模拟和与现有加权方案的比较展示了理论结果。最后,我们简要讨论了当真实方差未知时如何使用估计的信号和噪声方差,并在来自天文学的真实数据上说明了最优权重。

关键词

引用

@article{arxiv.1810.12862,
  title  = {Optimally Weighted PCA for High-Dimensional Heteroscedastic Data},
  author = {David Hong and Fan Yang and Jeffrey A. Fessler and Laura Balzano},
  journal= {arXiv preprint arXiv:1810.12862},
  year   = {2022}
}

备注

39 pages, 9 figures