中文

CNN 第一层学到了什么以及为何?——一种线性系统视角

计算机视觉与模式识别 2026-04-01 v2

摘要

此前已有报道指出,深度卷积神经网络(CNN)第一层所学到的表示在不同初始化与架构间高度一致。本文中,我们将第一层视为滤波器组并度量其能量分布,从而量化这种一致性。我们发现该能量分布与初始权重的能量分布截然不同,并且在随机初始化、数据集、架构甚至 CNN 使用随机标签训练时都异常一致。为解释此一致性,我们推导了线性 CNN 能量分布的解析公式,并表明该分布主要由训练集中图像块的二阶统计量决定,且当迭代次数趋于无穷时将逼近白化变换。最后,我们证明该线性 CNN 公式也能极好地拟合 ResNet 与 VGG 等常用非线性 CNN 学到的能量分布,且这些 CNN 的第一层确实对其输入执行了近似白化。

关键词

引用

@article{arxiv.2206.02454,
  title  = {What do CNNs Learn in the First Layer and Why? A Linear Systems Perspective},
  author = {Rhea Chowers and Yair Weiss},
  journal= {arXiv preprint arXiv:2206.02454},
  year   = {2026}
}