中文

所有稀疏 PCA 模型都是错的,但有些是有用的。第一部分:分数、残差与解释方差的计算

机器学习 2020-11-19 v1 机器学习

摘要

稀疏主成分分析(sPCA)是一种基于主成分分析(PCA)的流行矩阵分解方法,它结合方差最大化与稀疏性,最终目标是改进数据解释。从 PCA 转向 sPCA 时,实践者需要注意若干影响。其中一个相关问题是 sPCA 中的分数与载荷可能不正交。因此,经典 PCA 中使用的计算分数、残差与解释方差的传统方式不能直接应用于 sPCA 模型。这也影响了 sPCA 分量应如何可视化。在本文中,我们使用针对若干最先进 sPCA 算法的模拟,从理论与数值上阐明该问题,并给出上述不同元素的正确计算。我们表明,在对无噪声稀疏数据建模时,sPCA 方法呈现出 disparate 且有限的表现。在后续论文中,我们将讨论导致该问题的理论性质。

关键词

引用

@article{arxiv.1907.03989,
  title  = {All Sparse PCA Models Are Wrong, But Some Are Useful. Part I: Computation of Scores, Residuals and Explained Variance},
  author = {J. Camacho and A. K. Smilde and E. Saccenti and J. A. Westerhuis},
  journal= {arXiv preprint arXiv:1907.03989},
  year   = {2020}
}