中文

针对 p>100 万的快速精确 Bootstrap 主成分分析

统计方法学 2014-05-15 v3 应用统计 统计计算

摘要

许多人提出了一种 Bootstrap 过程来估计主成分分析 (PCA) 结果的抽样变异性。然而,当每个受试者的测量数 (pp) 远大于受试者数量 (nn) 时,计算和存储每个 Bootstrap 样本的主导主成分在计算上可能不可行。为解决这一问题,我们概述了快速、精确计算 Bootstrap 主成分、特征值和得分的方法。我们的方法利用了一个事实,即所有 Bootstrap 样本都占据与原始样本相同的 nn 维子空间。因此,所有 Bootstrap 主成分都被限制在同一个 nn 维子空间内,并可以通过其在该子空间中的低维坐标进行有效表示。仅基于这些低维坐标的 Bootstrap 分布即可计算多种不确定性度量,而无需计算或存储 pp 维 Bootstrap 分量。快速 Bootstrap PCA 被应用于睡眠脑电图 (EEG) 记录数据集 (p=900p=900, n=392n=392) 和脑部磁共振成像 (MRI) 数据集 (pp\approx 300 万,n=352n=352)。对于脑部 MRI 数据集,我们的方法使得在标准笔记本电脑上基于 1000 个 Bootstrap 样本计算前 3 个主成分的标准误仅需 47 分钟,而使用标准方法则需约 4 天。

关键词

引用

@article{arxiv.1405.0922,
  title  = {Fast, Exact Bootstrap Principal Component Analysis for p>1 million},
  author = {Aaron Fisher and Brian Caffo and Brian Schwartz and Vadim Zipunnikov},
  journal= {arXiv preprint arXiv:1405.0922},
  year   = {2014}
}

备注

25 pages, including 9 figures and link to R package. 2014-05-14 update: final formatting edits for journal submission, condensed figures