中文

梯度下降对 ReLU 网络特征的量化效应

机器学习 2018-03-23 v1 机器学习

摘要

深度神经网络通常在过参数化区域(即参数远多于训练样本)进行训练,理解为何训练能收敛到具有泛化能力的解仍是一个开放问题。多项研究强调了训练过程(即小批量随机梯度下降 (SGD))会导致在损失景观中具有特定性质的解。然而,即使在纯梯度下降 (GD) 下,在过参数化区域中找到的解也相当好,而这一现象尚缺乏理解。我们在小初始化和小学习率的假设下,对具有 ReLU 激活函数的前馈网络提出了对此行为的分析,并揭示了一种量化效应:权重向量倾向于聚集在由输入数据确定的少数几个方向上。由此,我们证明对于给定的输入数据,只能得到有限多个“简单”函数,且与网络规模无关。这使得这些函数与线性插值类似(对于给定的输入数据,存在有限多个三角剖分,每个三角剖分通过线性插值确定一个函数)。我们探讨这种类比是否可推广至泛化性质——尽管通常的分布无关泛化性质不成立,但例如对于具有有界二阶导数的平滑函数,可能存在某种逼近性质,这可以“解释”网络(规模无界时)对未见输入的泛化能力。

关键词

引用

@article{arxiv.1803.08367,
  title  = {Gradient Descent Quantizes ReLU Network Features},
  author = {Hartmut Maennel and Olivier Bousquet and Sylvain Gelly},
  journal= {arXiv preprint arXiv:1803.08367},
  year   = {2018}
}