近乎最优的张量草图
数据结构与算法
2019-09-05 v1 机器学习
概率论
机器学习
摘要
我们构造一个矩阵 M∈Rm⊗dc,其行数仅为 m=O(cλε−2polylog1/εδ),该矩阵以至少 1−δ 的概率保持任意给定 Rd 的 λ 维子空间中所有 x 的范数 ∥Mx∥2=(1±ε)∥x∥2。该矩阵可应用于张量 x(1)⊗⋯⊗x(c)∈Rdc,耗时为 O(cmmin{d,m})——因此得名“Tensor Sketch”(张量草图)。(此处 x⊗y=asvec(xyT)=[x1y1,x1y2,…,x1ym,x2y1,…,xnym]∈Rnm。)这改进了 Pagh 和 Pham~[TOCT 2013, SIGKDD 2013] 以及 Avron 等人~[NIPS 2014] 早期的张量草图构造,后者在相同保证下需要 m=Ω(3cλ2δ−1) 行。λ、ε−2 和 log1/δ 这些因子均可证明是必要的,使得我们的草图在对数因子范围内是最优的。通过另一种构造,我们得到多 λ 倍的行数 m=O~(cλ2ε−2(log1/δ)3),但该矩阵可应用于任意向量 x(1)⊗⋯⊗x(c)∈Rdc,耗时仅 O~(c(d+m))。这与 Tensor Sketch 的应用时间相匹配,同时仍改进了关于 c 和 log1/δ 的指数依赖。从技术上讲,我们展示了两个主要引理:(1) 对于许多 Johnson Lindenstrauss(JL)构造,若 Q,Q′∈Rm×d 是独立的 JL 矩阵,则逐元素乘积 Qx∘Q′y 等于某个 M∈Rm×d2 的 M(x⊗y),而该 M 本身也是 JL 矩阵。(2) 若 M(i)∈Rm×md 是独立的 JL 矩阵,则 M(1)(x⊗(M(2)y⊗…))=M(x⊗y⊗…) 对某个 M∈Rm×dc 成立,且该 M 本身也是 JL 矩阵。结合这两个结果给出了对任意大小张量的高效草图。
引用
@article{arxiv.1909.01821,
title = {Almost Optimal Tensor Sketch},
author = {Thomas D. Ahle and Jakob B. T. Knudsen},
journal= {arXiv preprint arXiv:1909.01821},
year = {2019}
}