窥探残差学习的幕后
计算机视觉与模式识别
2024-02-14 v1 机器学习
摘要
残差学习已在深度且可扩展的神经网络中得到广泛应用。然而,促成残差学习成功的基本原理仍然难以捉摸,从而阻碍了具有深度可扩展性的普通网络的有效训练。在本文中,我们通过揭示导致普通神经网络收敛失败的“输入耗散”现象,窥探了残差学习的幕后:由于非线性,输入在普通层中逐渐受损,导致学习特征表示面临挑战。我们从理论上证明了普通神经网络如何将输入退化为随机噪声,并强调了残差连接作为维持更高存活神经元下界的解决方案的重要性。基于我们的理论发现,我们提出了“普通神经网络假设”(PNNH),该假设确定了非线性层之间的内部路径是残差学习中最关键的部分,并建立了一种支持训练不含残差连接的深度普通神经网络的范式。我们在流行的视觉基准上全面评估了启用 PNNH 的 CNN 架构和 Transformer,显示出与 ResNets 和视觉 Transformer 相当的准确性,训练吞吐量高出多达 0.3%,参数效率提高 2 倍。
引用
@article{arxiv.2402.08645,
title = {Peeking Behind the Curtains of Residual Learning},
author = {Tunhou Zhang and Feng Yan and Hai Li and Yiran Chen},
journal= {arXiv preprint arXiv:2402.08645},
year = {2024}
}
备注
Arxiv Preprint