中文

内存受限的流式主成分分析

机器学习 2013-07-02 v1 信息论 机器学习 math.IT

摘要

我们考虑高维情形下内存受限的流式、单次遍历主成分分析 (PCA)。在此设定中,pp 维样本按顺序呈现,目标是生成最能近似这些点的 kk 维子空间。标准算法需要 O(p2)O(p^2) 内存;同时,没有任何算法能优于 O(kp)O(kp) 内存,因为输出本身就需要这么多内存。只有在结合计算复杂度和样本复杂度的背景下理解,内存(或存储)复杂度才最具意义。高维 PCA 的样本复杂度通常在{\em尖峰协方差模型} (spiked covariance model) 的设定下进行研究,其中 pp 维点由总体协方差生成,该协方差等于单位矩阵(白噪声)加上一个低维扰动(尖峰),后者即为待恢复的信号。目前学界已充分理解,当样本数 nn 与维度 pp 成比例缩放时,尖峰可以被恢复。然而,所有能严格证明达到这一点的算法,其内存复杂度均为 O(p2)O(p^2)。与此同时,内存复杂度为 O(kp)O(kp) 的算法在样本复杂度上没有可与 pp 相比拟的严格界限。我们提出了一种同时实现这两点的算法:它使用 O(kp)O(kp) 内存(指任何形式的存储),并能够以 O(plogp)O(p \log p) 的样本复杂度计算 kk 维尖峰——这是此类首个算法。虽然我们的理论分析集中于尖峰协方差模型,但模拟结果显示,我们的算法在更广泛的数据模型上也能取得成功。

关键词

引用

@article{arxiv.1307.0032,
  title  = {Memory Limited, Streaming PCA},
  author = {Ioannis Mitliagkas and Constantine Caramanis and Prateek Jain},
  journal= {arXiv preprint arXiv:1307.0032},
  year   = {2013}
}