中文

矩阵分解中的梯度下降:理解大初始化

最优化与控制 2024-06-04 v2 机器学习

摘要

梯度下降(GD)已被证明能有效求解各类矩阵分解问题。然而,其在大初始值下的优化行为仍知之甚少。为弥补这一空白,本文提出一个新颖的理论框架,用于考察具有大初始化的 GD 的收敛轨迹。该框架基于信噪比概念与归纳论证。结果揭示了 GD 中一种隐式增量学习现象,并加深了对其在大初始化场景下性能的理解。

关键词

引用

@article{arxiv.2305.19206,
  title  = {Gradient descent in matrix factorization: Understanding large initialization},
  author = {Hengchao Chen and Xin Chen and Mohamad Elmasri and Qiang Sun},
  journal= {arXiv preprint arXiv:2305.19206},
  year   = {2024}
}

备注

Published in the 40th Conference on Uncertainty in Artificial Intelligence (UAI 2024)