中文

带缺失数据的流式异方差概率 PCA

信号处理 2025-04-09 v2

摘要

流式主成分分析(PCA)是大规模机器学习中用于从高速到达的极高维数据快速估计低维子空间的重要工具。然而,现代数据集日益融合来自多种来源的数据,因此可能在样本间呈现异质质量。标准流式 PCA 算法未考虑非均匀噪声,故其子空间估计会迅速退化。尽管近期提出的异方差概率 PCA 技术(HePPCAT)解决了该异质性,但其并非为处理可能呈现非平稳行为的流式数据而设计。此外,HePPCAT 不允许数据存在缺失项,而这在流式数据中常见。本文提出流式异方差 PCA 算法(SHASTA-PCA)以弥合此鸿沟。SHASTA-PCA 采用随机交替期望最大化方法,从可能含缺失项与异方差噪声的流式数据中联合学习低秩潜在因子与未知噪声方差,同时保持低内存与计算开销。数值实验表明,在异方差设定下,我们的方法相较最先进流式 PCA 算法具有更优的子空间估计。最后,我们展示了 SHASTA-PCA 应用于来自天文学的高度异质真实数据。

关键词

引用

@article{arxiv.2310.06277,
  title  = {Streaming Heteroscedastic Probabilistic PCA with Missing Data},
  author = {Kyle Gilman and David Hong and Jeffrey A. Fessler and Laura Balzano},
  journal= {arXiv preprint arXiv:2310.06277},
  year   = {2025}
}

备注

19 pages, 6 figures