矩形矩阵分解与线性神经网络的纳斯特罗夫加速梯度可证明加速
机器学习
2024-12-03 v3 最优化与控制
机器学习
摘要
我们研究了一阶方法在矩形矩阵分解中的收敛速度,这是一种标准的非凸优化问题。具体而言,给定秩为 r 的矩阵 ,我们证明了梯度下降(GD)可以在高概率下找到一对 -最优解 和 ,其中 ,满足 ,在 次迭代中,其中 表示矩阵 的条件数。此外,我们证明了纳斯特罗夫加速梯度(NAG)达到 的迭代复杂度,这是已知矩形矩阵分解中一阶方法的最佳界限。与现有文献中小型平衡随机初始化不同,我们采用不平衡初始化,其中 较大而 为 0。此外,我们的初始化和分析可以进一步扩展到线性神经网络,其中我们证明了 NAG 也能达到加速的线性收敛速度。特别是,我们只要求网络的宽度大于或等于输出标签矩阵的秩。相比,先前实现相同速率的结果要求网络宽度过大,此外还取决于输入数据矩阵的条件数和秩。
引用
@article{arxiv.2410.09640,
title = {Provable Acceleration of Nesterov's Accelerated Gradient for Rectangular Matrix Factorization and Linear Neural Networks},
author = {Zhenghao Xu and Yuqing Wang and Tuo Zhao and Rachel Ward and Molei Tao},
journal= {arXiv preprint arXiv:2410.09640},
year = {2024}
}
备注
30 pages (checklist included)