中文

输入稀疏时间内张量积矩阵的杠杆分数采样

机器学习 2022-06-27 v2 数据结构与算法

摘要

我们提出一种输入稀疏时间的采样算法,可使用近乎最优的样本数谱逼近对应于 qq 个矩阵的 qq 重按列张量积的 Gram 矩阵,相比此前所有已知方法在 poly(q)(q) 因子上有所改进。此外,对于数据集的 qq 重自张量这一重要特例(即 qq 次多项式核的特征矩阵),我们方法运行时间的主导项与输入数据集的大小成正比,且不依赖于 qq。先前的技术要么在运行时间上产生 poly(q)(q) 的减速,要么以消除对 qq 的依赖为代价而具有次优的目标维度,并且其运行时间对数据点数量呈二次依赖。我们的采样技术依赖于一组 qq 个部分相关的随机投影,它们可同时应用于数据集 XX,总时间仅取决于 XX 的大小,同时它们的 qq 重 Kronecker 积对 XqX^{\otimes q} 列空间中的任意固定向量近似为等距映射。我们还表明,我们的采样方法可推广到多项式核以外的其他核类,如高斯核与神经切线核(Neural Tangent kernels)。

关键词

引用

@article{arxiv.2202.04515,
  title  = {Leverage Score Sampling for Tensor Product Matrices in Input Sparsity Time},
  author = {David P. Woodruff and Amir Zandieh},
  journal= {arXiv preprint arXiv:2202.04515},
  year   = {2022}
}