所有稀疏 PCA 模型都是错的,但有些是有用的。第一部分:分数、残差与解释方差的计算
机器学习
2020-11-19 v1 机器学习
摘要
稀疏主成分分析(sPCA)是一种基于主成分分析(PCA)的流行矩阵分解方法,它结合方差最大化与稀疏性,最终目标是改进数据解释。从 PCA 转向 sPCA 时,实践者需要注意若干影响。其中一个相关问题是 sPCA 中的分数与载荷可能不正交。因此,经典 PCA 中使用的计算分数、残差与解释方差的传统方式不能直接应用于 sPCA 模型。这也影响了 sPCA 分量应如何可视化。在本文中,我们使用针对若干最先进 sPCA 算法的模拟,从理论与数值上阐明该问题,并给出上述不同元素的正确计算。我们表明,在对无噪声稀疏数据建模时,sPCA 方法呈现出 disparate 且有限的表现。在后续论文中,我们将讨论导致该问题的理论性质。
引用
@article{arxiv.1907.03989,
title = {All Sparse PCA Models Are Wrong, But Some Are Useful. Part I: Computation of Scores, Residuals and Explained Variance},
author = {J. Camacho and A. K. Smilde and E. Saccenti and J. A. Westerhuis},
journal= {arXiv preprint arXiv:1907.03989},
year = {2020}
}