针对 p>100 万的快速精确 Bootstrap 主成分分析
统计方法学
2014-05-15 v3 应用统计
统计计算
摘要
许多人提出了一种 Bootstrap 过程来估计主成分分析 (PCA) 结果的抽样变异性。然而,当每个受试者的测量数 () 远大于受试者数量 () 时,计算和存储每个 Bootstrap 样本的主导主成分在计算上可能不可行。为解决这一问题,我们概述了快速、精确计算 Bootstrap 主成分、特征值和得分的方法。我们的方法利用了一个事实,即所有 Bootstrap 样本都占据与原始样本相同的 维子空间。因此,所有 Bootstrap 主成分都被限制在同一个 维子空间内,并可以通过其在该子空间中的低维坐标进行有效表示。仅基于这些低维坐标的 Bootstrap 分布即可计算多种不确定性度量,而无需计算或存储 维 Bootstrap 分量。快速 Bootstrap PCA 被应用于睡眠脑电图 (EEG) 记录数据集 (, ) 和脑部磁共振成像 (MRI) 数据集 ( 300 万,)。对于脑部 MRI 数据集,我们的方法使得在标准笔记本电脑上基于 1000 个 Bootstrap 样本计算前 3 个主成分的标准误仅需 47 分钟,而使用标准方法则需约 4 天。
引用
@article{arxiv.1405.0922,
title = {Fast, Exact Bootstrap Principal Component Analysis for p>1 million},
author = {Aaron Fisher and Brian Caffo and Brian Schwartz and Vadim Zipunnikov},
journal= {arXiv preprint arXiv:1405.0922},
year = {2014}
}
备注
25 pages, including 9 figures and link to R package. 2014-05-14 update: final formatting edits for journal submission, condensed figures