关于神经网络表征中块结构现象的起源
机器学习
2022-02-16 v1
摘要
近期工作揭示了一个引人注目的现象:大容量神经网络包含具有高度相似表征的连续隐藏层块。该块结构具有两个看似矛盾的特性:一方面,其组成层展现出高度相似的主导第一主成分(PC),但另一方面,它们的表征及其共同的第一 PC 在不同随机种子间高度不相似。我们的工作旨在通过研究与数据和训练方法相关的块结构起源来调和这些差异特性。通过分析主导 PC 的性质,我们发现块结构源于主导数据点——一组共享相似图像统计特性(如背景颜色)的少量样本。然而,主导数据点集合及具体的共享图像统计特性可随随机种子变化。因此,块结构反映了有意义的数据集统计特性,但同时对每个模型而言是独特的。通过研究隐藏层激活并创建合成数据点,我们证明了这些简单的图像统计特性主导了块结构内部各层的表征几何。我们探究了该现象在训练过程中的演变,发现块结构在训练早期即形成,但底层表征及相应的主导数据点持续发生显著变化。最后,我们研究了块结构与不同训练机制间的相互作用,引入了消除块结构的有针对性干预,并考察了预训练与 Shake-Shake 正则化的影响。
引用
@article{arxiv.2202.07184,
title = {On the Origins of the Block Structure Phenomenon in Neural Network Representations},
author = {Thao Nguyen and Maithra Raghu and Simon Kornblith},
journal= {arXiv preprint arXiv:2202.07184},
year = {2022}
}