用于主成分分析的非贪婪L21范数最大化
机器学习
2016-03-29 v1
摘要
主成分分析(PCA)是处理高维数据最重要的无监督方法之一。然而,由于其特征分解解的高计算复杂度,难以将PCA应用于大规模高维数据。同时,基于平方L2范数的目标函数使其对数据离群点敏感。在最近的研究中,提出了基于L1范数最大化的PCA方法以实现高效计算并对离群点鲁棒。然而,该工作使用贪婪策略来求解特征向量。此外,基于L1范数最大化的目标可能不是正确的鲁棒PCA形式,因为它失去了与数据重构误差最小化之间的理论联系,而后者是PCA最重要的直觉和目标之一。在本文中,我们提出最大化基于L21范数的鲁棒PCA目标,该目标在理论上与重构误差最小化相联系。更重要的是,我们提出了高效的非贪婪优化算法来求解我们的目标以及更一般的L21范数最大化问题,并具有理论保证的收敛性。在真实世界数据集上的实验结果展示了所提方法用于主成分分析的有效性。
引用
@article{arxiv.1603.08293,
title = {Non-Greedy L21-Norm Maximization for Principal Component Analysis},
author = {Feiping Nie and Heng Huang},
journal= {arXiv preprint arXiv:1603.08293},
year = {2016}
}