中文

超越过参数化张量分解的惰性训练

机器学习 2020-10-23 v1 机器学习

摘要

过参数化是训练神经网络的一项重要技术。在理论与实践中,训练更大的网络可使优化算法避免糟糕的局部最优解。在本文中,我们研究一个紧密相关的张量分解问题:给定 (Rd)l(R^d)^{\otimes l} 中秩为 rr(其中 rdr\ll d)的 ll 阶张量,梯度下降的变体能否找到秩为 mm 的分解,其中 m>rm > r?我们表明,在惰性训练机制(类似于神经网络的 NTK 机制)下,至少需要 m=Ω(dl1)m = \Omega(d^{l-1}),而梯度下降的一种变体可在 m=O(r2.5llogd)m = O^*(r^{2.5l}\log d) 时找到近似张量。我们的结果表明,过参数化目标上的梯度下降可以超越惰性训练机制,并利用数据中的某些低秩结构。

关键词

引用

@article{arxiv.2010.11356,
  title  = {Beyond Lazy Training for Over-parameterized Tensor Decomposition},
  author = {Xiang Wang and Chenwei Wu and Jason D. Lee and Tengyu Ma and Rong Ge},
  journal= {arXiv preprint arXiv:2010.11356},
  year   = {2020}
}

备注

NeurIPS 2020; the first two authors contribute equally