流式核主成分分析
数据结构与算法
2015-12-17 v1 机器学习
机器学习
摘要
核主成分分析(KPCA)提供了一组简洁的基向量,用于捕捉大型数据集中的非线性结构,是数据分析与学习中的核心工具。为了允许非线性关系,通常会在 个数据点上构造一个完整的 核矩阵,但这对于较大的 需要过多的空间和时间。诸如Nyström方法和随机特征映射等技术有助于实现这一目标,但它们不能在流中显式维护基向量,且占用的空间超出预期。我们提出了一种用于流式KPCA的新方法,该方法在流中维护一小组基元素,所需空间仅关于 对数级,并且改善了对误差参数的依赖。我们的技术将随机特征映射与矩阵草图的最新进展相结合,相对于原始核矩阵具有有保障的谱范数误差界,并且在实践中优于最先进的方法。
引用
@article{arxiv.1512.05059,
title = {Streaming Kernel Principal Component Analysis},
author = {Mina Ghashami and Daniel Perry and Jeff M. Phillips},
journal= {arXiv preprint arXiv:1512.05059},
year = {2015}
}