关于残差网络深度
机器学习
2025-10-09 v2 机器学习
摘要
深度残差架构(如 ResNet 和 Transformer)已实现了前所未有的深度模型,但对深度为何如此有效的正式理解仍是开放问题。流行的直觉认为,这些残差网络行为类似于许多更浅层模型的集合。我们的关键发现是,一个显式解析公式验证了这一集合视角,证明增加网络深度在数学上等效于扩大这一隐式集合的规模。进一步地,我们的扩展揭示了这些网络中存在的层次化集合结构,其中计算路径的组合增长导致输出信号指数级增长,解释了历史上在训练深层模型中必需使用归一化层的原因。这一洞察提供了对历史上归一化层依赖性的首要原则解释,并为诸如 SkipInit 和 Fixup 等无归一化技术的成功提供了新视角。然而,虽然这些先前方法通过优化器分析或对批归一化的启发式类比推断缩放因子,但我们的工作则直接从网络固有的功能结构中导出解释。具体而言,我们的残差扩张定理表明,对每个残差模块进行缩放提供了一种原则化的解决方案,用于驯服这些架构固有的组合爆炸。我们进一步展示,这种缩放充当容量控制器,同时隐式正则化模型的复杂性。
引用
@article{arxiv.2510.03470,
title = {On residual network depth},
author = {Benoit Dherin and Michael Munn},
journal= {arXiv preprint arXiv:2510.03470},
year = {2025}
}