中文

矩形矩阵分解与线性神经网络的纳斯特罗夫加速梯度可证明加速

机器学习 2024-12-03 v3 最优化与控制 机器学习

摘要

我们研究了一阶方法在矩形矩阵分解中的收敛速度,这是一种标准的非凸优化问题。具体而言,给定秩为 r 的矩阵 ARm×n\mathbf{A}\in\mathbb{R}^{m\times n},我们证明了梯度下降(GD)可以在高概率下找到一对 ϵ\epsilon-最优解 XTRm×d\mathbf{X}_T\in\mathbb{R}^{m\times d}YTRn×d\mathbf{Y}_T\in\mathbb{R}^{n\times d},其中 drd\geq r,满足 XTYTAFϵAF\lVert\mathbf{X}_T\mathbf{Y}_T^\top-\mathbf{A}\rVert_\mathrm{F}\leq\epsilon\lVert\mathbf{A}\rVert_\mathrm{F},在 T=O(κ2log1ϵ)T=O(\kappa^2\log\frac{1}{\epsilon}) 次迭代中,其中 κ\kappa 表示矩阵 A\mathbf{A} 的条件数。此外,我们证明了纳斯特罗夫加速梯度(NAG)达到 O(κlog1ϵ)O(\kappa\log\frac{1}{\epsilon}) 的迭代复杂度,这是已知矩形矩阵分解中一阶方法的最佳界限。与现有文献中小型平衡随机初始化不同,我们采用不平衡初始化,其中 X0\mathbf{X}_0 较大而 Y0\mathbf{Y}_0 为 0。此外,我们的初始化和分析可以进一步扩展到线性神经网络,其中我们证明了 NAG 也能达到加速的线性收敛速度。特别是,我们只要求网络的宽度大于或等于输出标签矩阵的秩。相比,先前实现相同速率的结果要求网络宽度过大,此外还取决于输入数据矩阵的条件数和秩。

关键词

引用

@article{arxiv.2410.09640,
  title  = {Provable Acceleration of Nesterov's Accelerated Gradient for Rectangular Matrix Factorization and Linear Neural Networks},
  author = {Zhenghao Xu and Yuqing Wang and Tuo Zhao and Rachel Ward and Molei Tao},
  journal= {arXiv preprint arXiv:2410.09640},
  year   = {2024}
}

备注

30 pages (checklist included)