内存受限的流式主成分分析
机器学习
2013-07-02 v1 信息论
机器学习
math.IT
摘要
我们考虑高维情形下内存受限的流式、单次遍历主成分分析 (PCA)。在此设定中, 维样本按顺序呈现,目标是生成最能近似这些点的 维子空间。标准算法需要 内存;同时,没有任何算法能优于 内存,因为输出本身就需要这么多内存。只有在结合计算复杂度和样本复杂度的背景下理解,内存(或存储)复杂度才最具意义。高维 PCA 的样本复杂度通常在{\em尖峰协方差模型} (spiked covariance model) 的设定下进行研究,其中 维点由总体协方差生成,该协方差等于单位矩阵(白噪声)加上一个低维扰动(尖峰),后者即为待恢复的信号。目前学界已充分理解,当样本数 与维度 成比例缩放时,尖峰可以被恢复。然而,所有能严格证明达到这一点的算法,其内存复杂度均为 。与此同时,内存复杂度为 的算法在样本复杂度上没有可与 相比拟的严格界限。我们提出了一种同时实现这两点的算法:它使用 内存(指任何形式的存储),并能够以 的样本复杂度计算 维尖峰——这是此类首个算法。虽然我们的理论分析集中于尖峰协方差模型,但模拟结果显示,我们的算法在更广泛的数据模型上也能取得成功。
引用
@article{arxiv.1307.0032,
title = {Memory Limited, Streaming PCA},
author = {Ioannis Mitliagkas and Constantine Caramanis and Prateek Jain},
journal= {arXiv preprint arXiv:1307.0032},
year = {2013}
}