中文

无正则化矩阵补全中小初始化梯度下降的收敛性

机器学习 2024-02-13 v1 最优化与控制 机器学习

摘要

我们研究对称矩阵补全问题,目标是从部分观测条目中重建由UU\rm{U}\rm{U}^{\top}参数化的秩为rr的正半定矩阵XRd×d\rm{X}^\star \in \mathbb{R}^{d\times d}。我们证明,无需任何显式正则化,小初始化的vanilla梯度下降(GD)可证明收敛到真实矩阵X\rm{X}^\star。即使在过参数化场景下(真实秩rr未知并被搜索秩rrr'\gg r保守高估),该收敛结果仍然成立。现有结果要么需要显式正则化、足够精确的初始点,要么需要精确知道真实秩rr。在rrr'\geq r的过参数化区域,我们证明,在Ω~(dr9)\widetilde\Omega(dr^9)个观测下,初始点满足U0ϵ\|\rm{U}_0\| \leq \epsilon的GD以近线性速度收敛到X\rm{X}^\starϵ\epsilon-邻域。因此,更小的初始点产生更精确的解。令人惊讶的是,收敛速度和最终精度均不依赖于过参数化搜索秩rr',而仅由真实秩rr决定。在r=rr'=r的精确参数化区域,我们进一步改进结果,证明若初始点满足U0=O(1/d)\|\rm{U}_0\| = O(1/d),GD以更快的速度收敛到任意小的精度ϵ>0\epsilon>0。我们方法的核心在于一种新颖的弱耦合留一分析,它使我们能够建立GD的全局收敛性,超越了经典留一分析此前所能达到的范围。

关键词

引用

@article{arxiv.2402.06756,
  title  = {Convergence of Gradient Descent with Small Initialization for Unregularized Matrix Completion},
  author = {Jianhao Ma and Salar Fattahi},
  journal= {arXiv preprint arXiv:2402.06756},
  year   = {2024}
}