让深度网络再度变浅
机器学习
2024-05-02 v1
摘要
深度神经网络有良好的成功记录,因此被视为复杂应用的最佳架构选择。长期以来,其主要缺陷是梯度消失,阻碍了数值优化算法获得可接受收敛。残差连接——与传统层并行的恒等映射——的概念实现了突破。该概念适用于同维层的堆叠,并大幅缓解梯度消失问题。残差连接层堆叠可表示为类似于泰勒展开的项展开。该展开提示了截断高阶项并得到一个由所有初始堆叠层并行组成的单一宽层架构的可能性。换言之,序贯深度架构被并行浅层架构替代。受该理论启发,我们研究了并行架构相对于序贯架构的性能能力。计算机视觉数据集 MNIST 和 CIFAR10 用于训练两种架构,共 6912 种卷积层数、滤波器数、核大小及其他元参数的组合变化。我们的发现展示了深度(序贯)与浅层(并行)架构间令人惊讶的等价性。两种布局在训练与验证集损失方面产生相似结果。该发现意味着宽浅架构可在不牺牲性能下潜在替代深度网络。此类替代有简化网络架构、提升优化效率及加速训练过程的潜力。
引用
@article{arxiv.2309.08414,
title = {Make Deep Networks Shallow Again},
author = {Bernhard Bermeitinger and Tomas Hrycej and Siegfried Handschuh},
journal= {arXiv preprint arXiv:2309.08414},
year = {2024}
}
备注
to be published at KDIR2023, Rome