中文

稠密核矩阵在近线性计算复杂度下的压缩、求逆与近似主成分分析

数值分析 2020-11-03 v5 计算复杂性 数据结构与算法 数值分析 概率论

摘要

由协方差函数GG在位置{xi}1iNRd\{ x_{i} \}_{1 \leq i \leq N} \subset \mathbb{R}^{d}上的点赋值得到的稠密核矩阵ΘRN×N\Theta \in \mathbb{R}^{N \times N}出现在统计学、机器学习和数值分析中。对于作为椭圆边值问题格林函数的协方差函数和均匀分布的采样点,我们展示了如何识别一个子集S{1,,N}2S \subset \{ 1 , \dots , N \}^2,满足#S=O(Nlog(N)logd(N/ϵ))\# S = O ( N \log (N) \log^{d} ( N /\epsilon ) ),使得稀疏矩阵Θij1(i,j)S\Theta_{ij} 1_{( i, j ) \in S}的零填充不完全Cholesky分解是Θ\Theta的一个ϵ\epsilon-近似。该分解可在空间复杂度O(Nlog(N)logd(N/ϵ))O ( N \log( N ) \log^{d}( N /\epsilon) )和时间复杂度O(Nlog2(N)log2d(N/ϵ))O ( N \log^{2}( N ) \log^{2d}( N /\epsilon) )内可证明地获得,改进了针对一般椭圆算子的现有技术水平;我们进一步提供了数值证据,表明dd可以取为数据集的内蕴维度而非环境空间的维度。该算法仅需知道xix_{i}的空间配置,不需要GG的解析表示。此外,该分解直接提供了一种在算子范数下具有最优收敛速度的近似稀疏主成分分析。因此,仅通过使用子采样和不完全Cholesky分解,我们便以近线性复杂度获得了一大类协方差矩阵的压缩、求逆和近似主成分分析。通过反转Cholesky分解的顺序,我们还获得了一个椭圆偏微分方程求解器,其空间复杂度为O(Nlogd(N/ϵ))O ( N \log^{d}( N /\epsilon) ),时间复杂度为O(Nlog2d(N/ϵ))O ( N \log^{2d}( N /\epsilon) ),改进了针对一般椭圆算子的现有技术水平。

关键词

引用

@article{arxiv.1706.02205,
  title  = {Compression, inversion, and approximate PCA of dense kernel matrices at near-linear computational complexity},
  author = {Florian Schäfer and T. J. Sullivan and Houman Owhadi},
  journal= {arXiv preprint arXiv:1706.02205},
  year   = {2020}
}

备注

52 pages. A high level summary of this work can be found under https://f-t-s.github.io/projects/cholesky/