CNN 第一层学到了什么以及为何?——一种线性系统视角
计算机视觉与模式识别
2026-04-01 v2
摘要
此前已有报道指出,深度卷积神经网络(CNN)第一层所学到的表示在不同初始化与架构间高度一致。本文中,我们将第一层视为滤波器组并度量其能量分布,从而量化这种一致性。我们发现该能量分布与初始权重的能量分布截然不同,并且在随机初始化、数据集、架构甚至 CNN 使用随机标签训练时都异常一致。为解释此一致性,我们推导了线性 CNN 能量分布的解析公式,并表明该分布主要由训练集中图像块的二阶统计量决定,且当迭代次数趋于无穷时将逼近白化变换。最后,我们证明该线性 CNN 公式也能极好地拟合 ResNet 与 VGG 等常用非线性 CNN 学到的能量分布,且这些 CNN 的第一层确实对其输入执行了近似白化。
引用
@article{arxiv.2206.02454,
title = {What do CNNs Learn in the First Layer and Why? A Linear Systems Perspective},
author = {Rhea Chowers and Yair Weiss},
journal= {arXiv preprint arXiv:2206.02454},
year = {2026}
}