中文

近乎最优的张量草图

数据结构与算法 2019-09-05 v1 机器学习 概率论 机器学习

摘要

我们构造一个矩阵 MRmdcM\in R^{m\otimes d^c},其行数仅为 m=O(cλε2polylog1/εδ)m=O(c\,\lambda\,\varepsilon^{-2}\text{poly}\log1/\varepsilon\delta),该矩阵以至少 1δ1-\delta 的概率保持任意给定 Rd R^dλ\lambda 维子空间中所有 xx 的范数 Mx2=(1±ε)x2\|Mx\|_2=(1\pm\varepsilon)\|x\|_2。该矩阵可应用于张量 x(1)x(c)Rdcx^{(1)}\otimes\dots\otimes x^{(c)}\in R^{d^c},耗时为 O(cmmin{d,m})O(c\, m \min\{d,m\})——因此得名“Tensor Sketch”(张量草图)。(此处 xy=asvec(xyT)=[x1y1,x1y2,,x1ym,x2y1,,xnym]Rnmx\otimes y = \text{asvec}(xy^T) = [x_1y_1, x_1y_2,\dots,x_1y_m,x_2y_1,\dots,x_ny_m]\in R^{nm}。)这改进了 Pagh 和 Pham~[TOCT 2013, SIGKDD 2013] 以及 Avron 等人~[NIPS 2014] 早期的张量草图构造,后者在相同保证下需要 m=Ω(3cλ2δ1)m=\Omega(3^c\lambda^2\delta^{-1}) 行。λ\lambdaε2\varepsilon^{-2}log1/δ\log1/\delta 这些因子均可证明是必要的,使得我们的草图在对数因子范围内是最优的。通过另一种构造,我们得到多 λ\lambda 倍的行数 m=O~(cλ2ε2(log1/δ)3)m=\tilde O(c\,\lambda^2\,\varepsilon^{-2}(\log1/\delta)^3),但该矩阵可应用于任意向量 x(1)x(c)Rdcx^{(1)}\otimes\dots\otimes x^{(c)}\in R^{d^c},耗时仅 O~(c(d+m))\tilde O(c\, (d+m))。这与 Tensor Sketch 的应用时间相匹配,同时仍改进了关于 cclog1/δ\log1/\delta 的指数依赖。从技术上讲,我们展示了两个主要引理:(1) 对于许多 Johnson Lindenstrauss(JL)构造,若 Q,QRm×dQ,Q'\in R^{m\times d} 是独立的 JL 矩阵,则逐元素乘积 QxQyQx \circ Q'y 等于某个 MRm×d2M\in R^{m\times d^2}M(xy)M(x\otimes y),而该 MM 本身也是 JL 矩阵。(2) 若 M(i)Rm×mdM^{(i)}\in R^{m\times md} 是独立的 JL 矩阵,则 M(1)(x(M(2)y))=M(xy)M^{(1)}(x \otimes (M^{(2)}y \otimes \dots)) = M(x\otimes y\otimes \dots) 对某个 MRm×dcM\in R^{m\times d^c} 成立,且该 MM 本身也是 JL 矩阵。结合这两个结果给出了对任意大小张量的高效草图。

关键词

引用

@article{arxiv.1909.01821,
  title  = {Almost Optimal Tensor Sketch},
  author = {Thomas D. Ahle and Jakob B. T. Knudsen},
  journal= {arXiv preprint arXiv:1909.01821},
  year   = {2019}
}