理解梯度下降的增量学习:矩阵感知的细粒度分析
机器学习
2023-01-30 v1 最优化与控制
机器学习
摘要
人们认为梯度下降(GD)在训练机器学习模型时诱导出一种朝向良好泛化的隐式偏置。本文对矩阵感知问题中GD的动态提供了细粒度分析,该问题的目标是从近各向同性线性测量中恢复低秩真实矩阵。研究表明,小初始化的GD表现得类似于贪婪低秩学习启发式方法(Li et al., 2020)并遵循增量学习过程(Gissin et al., 2019):GD按顺序学习秩递增的解,直到恢复真实矩阵。与仅分析秩-1解的第一学习阶段的现有工作相比,我们的结果刻画了整个学习过程。此外,除许多先前工作关注的过参数化机制外,我们对增量学习过程的分析也适用于欠参数化机制。最后,我们进行数值实验以证实我们的理论发现。
引用
@article{arxiv.2301.11500,
title = {Understanding Incremental Learning of Gradient Descent: A Fine-grained Analysis of Matrix Sensing},
author = {Jikai Jin and Zhiyuan Li and Kaifeng Lyu and Simon S. Du and Jason D. Lee},
journal= {arXiv preprint arXiv:2301.11500},
year = {2023}
}