中文

训练不变性与低秩现象:超越线性网络

机器学习 2022-04-27 v2 最优化与控制

摘要

神经网络训练所诱导的隐式偏置已成为严格研究的课题。在梯度流与适当步长的梯度下降极限下,已有研究表明,当在线性可分数据上以 logistic 或指数损失训练深度线性网络时,权重收敛于秩为 1 的矩阵。在本文中,我们将这一理论结果推广到更广泛一类非线性 ReLU 激活前馈网络(包含全连接层与跳跃连接)的最后几个线性层。与线性情形类似,证明依赖于特定的局部训练不变性(有时称为对齐),我们证明其对在全部训练样本中稳定激活的神经元所对应的子矩阵成立,并且这与文献中的实证结果相符。我们还表明,这对于 ReLU 全连接层的完整矩阵一般而言并不成立。我们的证明依赖于将网络特定地分解为一个多线性函数与另一个 ReLU 网络,后者的权重在某一参数方向收敛下保持恒定。

关键词

引用

@article{arxiv.2201.11968,
  title  = {Training invariances and the low-rank phenomenon: beyond linear networks},
  author = {Thien Le and Stefanie Jegelka},
  journal= {arXiv preprint arXiv:2201.11968},
  year   = {2022}
}

备注

26 pages, 3 figures, ICLR2022