中文

基于平方和证明的张量主成分分析

机器学习 2015-07-14 v1 计算复杂性 数据结构与算法 机器学习

摘要

我们研究了由 Montanari 和 Richard 引入的张量主成分分析问题的统计模型:给定一个形如 T = τ · v_0^{⊗3} + A 的三阶张量 T,其中 τ ≥ 0 为信噪比,v_0 是一个单位向量,A 是随机噪声张量,目标是恢复植入的向量 v_0。对于 A 具有独立同分布标准高斯条目的情况,我们给出了一种高效算法,只要 τ ≥ ω(n^{3/4} log(n)^{1/4}),就能恢复 v_0,并证明恢复的向量接近最大似然估计量,所有这些在 A 的随机选择下都具有高概率。此前具有可证明保证的最佳算法要求 τ ≥ Ω(n)。在 τ ≤ o(n) 的范围内,基于自然张量展开的底层优化问题的谱松弛会失效(即其完整性间隙很大)。为了突破这一障碍,我们使用了基于平方和方法的凸松弛。我们的恢复算法通过对统计模型的最大似然估计问题进行度数为 4 的平方和松弛的舍入来进行。为了补充我们的算法结果,我们证明了度数为 4 的平方和松弛在 τ ≤ O(n^{3/4}/log(n)^{1/4}) 时会失效,这表明要改进我们当前的保证(超过对数因子)将需要新技术,甚至可能是棘手的。最后,我们展示了如何利用额外的问题结构,以非常高效的方式近似求解我们的平方和松弛。我们最快的算法使用平移(矩阵)幂迭代,运行时间接近线性,并具有与上述类似的保证。对该算法的分析也证实了 Montanari 和 Richard 关于张量展开奇异向量的一个猜想的变体。

关键词

引用

@article{arxiv.1507.03269,
  title  = {Tensor principal component analysis via sum-of-squares proofs},
  author = {Samuel B. Hopkins and Jonathan Shi and David Steurer},
  journal= {arXiv preprint arXiv:1507.03269},
  year   = {2015}
}

备注

published in Conference on Learning Theory (COLT) 2015 (submitted February 2015)