残差对齐:揭示残差网络的机制
机器学习
2024-01-18 v1
摘要
ResNet架构因其使用简单的跳跃连接显著提升性能而在深度学习中被广泛采用,但其成功背后的机制在很大程度上仍然未知。本文中,我们通过使用残差雅可比矩阵线性化其组成的残差块并测量其奇异值分解,对分类任务中的ResNet架构进行了彻底的实证研究。我们的测量揭示了一个称为残差对齐(Residual Alignment, RA)的过程,其特征为四个性质:(RA1)给定输入的中间表示在高维空间中嵌入的一条直线上等距分布,正如Gai和Zhang [2021]所观察到的;(RA2)残差雅可比矩阵的左上奇异向量相互对齐,并在不同深度间对齐;(RA3)对于全连接ResNet,残差雅可比矩阵的秩至多为C,其中C是类别数;(RA4)残差雅可比矩阵的顶部奇异值与深度成反比缩放。RA在泛化良好的模型中一致出现,涵盖全连接和卷积架构,跨越各种深度和宽度,针对不同数量的类别,在所有测试的基准数据集上均如此,但一旦移除跳跃连接就不再出现。它在我们提出的一个新数学模型中也可证明地出现。这一现象揭示了ResNet残差分支之间的强对齐性(RA2+4),赋予中间表示一种高度刚性的几何结构,使其线性地通过网络(RA1)直至最终层,在那里经历神经坍缩(Neural Collapse)。
引用
@article{arxiv.2401.09018,
title = {Residual Alignment: Uncovering the Mechanisms of Residual Networks},
author = {Jianing Li and Vardan Papyan},
journal= {arXiv preprint arXiv:2401.09018},
year = {2024}
}
备注
Accepted at NeurIPS 2023 as a Poster paper