深度线性网络梯度下降中的简约律
机器学习
2023-06-05 v1
摘要
在过去几年中,训练深度网络时被广泛研究的一个现象是梯度下降对简约解的隐式偏置。在这项工作中,我们通过将关注点缩小到深度线性网络来研究这一现象。通过我们的分析,我们揭示了当数据具有低维结构时学习动态中一个令人惊讶的“简约律”。具体而言,我们表明,从正交初始化开始的梯度下降的演化仅影响所有权重矩阵中奇异向量空间的最小部分。换句话说,尽管所有权重参数在训练过程中都被更新,但学习过程仅发生在每个权重矩阵的一个小不变子空间内。这种学习动态的简洁性可能对高效训练以及更好地理解深度网络具有重要意义。首先,该分析使我们能够通过利用学习动态中的低维结构来显著提高训练效率。我们可以构建更小的、等价的深度线性网络,而不牺牲与更宽网络相关的益处。其次,它通过阐明从浅层到深层表示的线性渐进分离与聚集,使我们更好地理解深度表示学习。我们还进行了数值实验以支持我们的理论结果。我们实验的代码可在 https://github.com/cjyaras/lawofparsimony 找到。
引用
@article{arxiv.2306.01154,
title = {The Law of Parsimony in Gradient Descent for Learning Deep Linear Networks},
author = {Can Yaras and Peng Wang and Wei Hu and Zhihui Zhu and Laura Balzano and Qing Qu},
journal= {arXiv preprint arXiv:2306.01154},
year = {2023}
}
备注
The first two authors contributed to this work equally; 32 pages, 12 figures