中文

低秩神经网络的非线性初始化方法

机器学习 2022-05-23 v3 人工智能 数据结构与算法 机器学习

摘要

我们提出一种用于训练低秩深度神经网络的新型低秩初始化框架——该网络的权重参数由两低秩矩阵之积重新参数化。现有最成功的先验方法谱初始化(spectral initialization),从全秩设定的初始化分布中采样,再通过奇异值分解以弗罗贝尼乌斯范数用一对低秩初始化矩阵最优逼近全秩初始化参数。我们的方法受如下洞见启发:逼近每一层对应的函数比逼近参数值更为重要。我们可证明地展示了,对于ReLU网络,这两种方法间存在显著差距,尤其当所需逼近权重的秩减小,或当该层输入维度增大(后者在网络宽度关于维度超线性时成立)。在此过程中,我们给出了首个可证明高效的算法以解决固定参数秩 rr 的ReLU低秩逼近问题——此前即便对于秩 11,该问题是否计算可解亦未知。我们还提供了求解该问题的实用算法,其开销不高于现有谱初始化方法,并在ImageNet(Russakovsky et al., 2015)上训练ResNet与EfficientNet模型(He et al., 2016; Tan & Le, 2019)验证了我们的理论。

关键词

引用

@article{arxiv.2202.00834,
  title  = {Nonlinear Initialization Methods for Low-Rank Neural Networks},
  author = {Kiran Vodrahalli and Rakesh Shivanna and Maheswaran Sathiamoorthy and Sagar Jain and Ed H. Chi},
  journal= {arXiv preprint arXiv:2202.00834},
  year   = {2022}
}

备注

32 pages, 4 figures, in submission. fixed some errors in previous versions and re-structured/re-focused the paper