中文

基于位翻转的高效 L1 范数主成分分析

数据结构与算法 2017-08-02 v1 机器学习 机器学习

摘要

最近的研究表明,实值数据矩阵 XRD×N\mathbf X \in \mathbb R^{D \times N}NNDD 维数据样本)的 KK 个 L1 范数主成分(L1-PCs)可以精确计算,其代价为 O(2NK)\mathcal{O}(2^{NK}),或在有利情况下为 O(NdKK+1)\mathcal{O}(N^{dK - K + 1}),其中 d=rank(X)d=\mathrm{rank}(\mathbf X)K<dK<d [1],[2]。在 X\mathbf X 很大的应用中(例如,大 NN 的“大”数据和/或大 dd 的“重”数据),这些代价是难以承受的。本文提出了一种新颖的次优算法,用于计算 X\mathbf XK<dK < d 个 L1-PCs,代价为 O(NDmin{N,D}+N2(K4+dK2)+dNK3)\mathcal O(ND \mathrm{min} \{ N,D\} + N^2(K^4 + dK^2) + dNK^3),与标准(L2 范数)主成分分析的代价相当。我们的理论和实验研究表明,所提算法以高频率计算出精确的最优 L1-PCs,并且在 L1-PC 优化指标上取得了比任何已知的、计算代价相当的替代算法更高的值。通过数据降维和基于基因组数据的疾病诊断实验,证明了计算出的 L1-PCs 在表征潜在有缺陷的数据/测量方面优于标准 L2-PCs(奇异向量)。

关键词

引用

@article{arxiv.1610.01959,
  title  = {Efficient L1-Norm Principal-Component Analysis via Bit Flipping},
  author = {Panos P. Markopoulos and Sandipan Kundu and Shubham Chamadia and Dimitris A. Pados},
  journal= {arXiv preprint arXiv:1610.01959},
  year   = {2017}
}