关于乘积PCA在排序鲁棒性上无效率损失的探讨
统计方法学
2025-03-24 v3
摘要
本文研究特征值排序的鲁棒性,这是利用主成分分析(PCA)估计前导特征子空间时的一个重要问题。Yata和Aoshima(2010)提出交叉数据矩阵PCA(CDM-PCA),并证明其在估计特征值时的偏倚小于PCA。尽管CDM-PCA有潜力比常规PCA更好地估计前导特征子空间,其鲁棒性并未得到充分认知。本文中,我们首先发展了CDM-PCA的一个更稳定变体,称之为乘积PCA(PPCA),其提供了更便于理论研究的表述。其次,我们证明在存在离群点时,PPCA在维持前导特征值正确排序上比PCA更鲁棒。PPCA的鲁棒性增益来自随机数据划分,且不依赖于多数鲁棒统计方法所采用的数据降权方案。这使我们得以确立一个令人惊讶的发现:当无离群点时,PPCA与PCA具有相同的渐近分布。亦即,PPCA在估计前导特征子空间上的鲁棒性增益相较于PCA并无效率损失。文中给出模拟研究及一个人脸数据示例以展示PPCA的优势。总之,无论是否存在离群点,PPCA均有良好潜力取代常规PCA在实际应用中的作用。
引用
@article{arxiv.2302.11124,
title = {On the efficiency-loss free ordering-robustness of product-PCA},
author = {Hung Hung and Su-Yun Huang},
journal= {arXiv preprint arXiv:2302.11124},
year = {2025}
}
备注
3 figures