中文

流式核主成分分析

数据结构与算法 2015-12-17 v1 机器学习 机器学习

摘要

核主成分分析(KPCA)提供了一组简洁的基向量,用于捕捉大型数据集中的非线性结构,是数据分析与学习中的核心工具。为了允许非线性关系,通常会在 nn 个数据点上构造一个完整的 n×nn \times n 核矩阵,但这对于较大的 nn 需要过多的空间和时间。诸如Nyström方法和随机特征映射等技术有助于实现这一目标,但它们不能在流中显式维护基向量,且占用的空间超出预期。我们提出了一种用于流式KPCA的新方法,该方法在流中维护一小组基元素,所需空间仅关于 nn 对数级,并且改善了对误差参数的依赖。我们的技术将随机特征映射与矩阵草图的最新进展相结合,相对于原始核矩阵具有有保障的谱范数误差界,并且在实践中优于最先进的方法。

关键词

引用

@article{arxiv.1512.05059,
  title  = {Streaming Kernel Principal Component Analysis},
  author = {Mina Ghashami and Daniel Perry and Jeff M. Phillips},
  journal= {arXiv preprint arXiv:1512.05059},
  year   = {2015}
}