中文

无捷径的深度学习:以定制整流器塑造核

机器学习 2022-03-16 v1 机器学习

摘要

训练极深神经网络仍是一项极具挑战性的任务。常见的解决方案是使用捷径连接与归一化层,二者均为流行的ResNet架构中的关键要素。然而,有强烈证据表明ResNet的行为更像是较浅网络的集成,而非真正的深层网络。近期研究表明,通过对激活函数施加特定变换,可训练深层vanilla网络(即不含归一化层或捷径连接的网络)达到与ResNet一样快。然而,该方法(称为Deep Kernel Shaping)与ReLU不完全兼容,且产生的网络在ImageNet上的过拟合显著强于ResNet。在本工作中,我们通过在开发一种与ReLU变体——Leaky ReLU——完全兼容的新型变换来纠正此状况。我们在实验中表明,我们的方法引入可忽略的额外计算成本,以深层vanilla网络取得了与ResNet(相同宽度/深度)竞争的验证准确率,且显著高于Edge of Chaos (EOC)方法所得。并且与EOC不同,我们获得的验证准确率不会随深度下降。

关键词

引用

@article{arxiv.2203.08120,
  title  = {Deep Learning without Shortcuts: Shaping the Kernel with Tailored Rectifiers},
  author = {Guodong Zhang and Aleksandar Botev and James Martens},
  journal= {arXiv preprint arXiv:2203.08120},
  year   = {2022}
}

备注

ICLR 2022