中文

矩阵分解的交替梯度下降收敛性

机器学习 2024-02-09 v2 最优化与控制 机器学习

摘要

我们考虑将固定步长的交替梯度下降(AGD)应用于非对称矩阵分解目标。我们证明,对于秩为 rr 的矩阵 ARm×n\mathbf{A} \in \mathbb{R}^{m \times n},从非典型的随机初始化出发,以高概率只需 T=C(σ1(A)σr(A))2log(1/ϵ)T = C (\frac{\sigma_1(\mathbf{A})}{\sigma_r(\mathbf{A})})^2 \log(1/\epsilon) 次交替梯度下降迭代即可达到 ϵ\epsilon-最优分解 AXYT2ϵA2\| \mathbf{A} - \mathbf{X} \mathbf{Y}^{T} \|^2 \leq \epsilon \| \mathbf{A}\|^2。因子具有秩 drd \geq r,从而 XTRm×d\mathbf{X}_{T}\in\mathbb{R}^{m \times d}YTRn×d\mathbf{Y}_{T} \in\mathbb{R}^{n \times d},且适度的过参数化足以使迭代复杂度 TT 中的常数 CC 成为绝对常数。实验表明,我们提出的初始化不仅具有理论益处,而且显著改善了实践中梯度下降的收敛速度。我们的证明在概念上简单:从我们的随机初始化开始,足够次数的迭代后保证一致的 Polyak-\L{}ojasiewicz (PL) 不等式和一致 Lipschitz 光滑常数。我们的证明方法应有助于扩展和简化更广泛一类非凸低秩分解问题的收敛性分析。

关键词

引用

@article{arxiv.2305.06927,
  title  = {Convergence of Alternating Gradient Descent for Matrix Factorization},
  author = {Rachel Ward and Tamara G. Kolda},
  journal= {arXiv preprint arXiv:2305.06927},
  year   = {2024}
}