通过隐藏层线性可分性理解深度神经网络
机器学习
2023-07-27 v1 人工智能
摘要
本文中,我们度量隐藏层输出的线性可分性以研究深度神经网络的特征。具体而言,我们首先提出基于闵可夫斯基差的线性可分性度量(MD-LSMs)来评估两个点集的线性可分程度。然后,我们证明了隐藏层输出的线性可分程度与网络训练性能之间存在同步性,即若更新的权重能增强隐藏层输出的线性可分程度,则更新后的网络将获得更好的训练性能,反之亦然。此外,我们研究了激活函数和网络规模(包括宽度和深度)对隐藏层线性可分性的影响。最后,我们在一些流行的深度网络上进行了数值实验以验证我们的发现,包括多层感知机(MLP)、卷积神经网络(CNN)、深度信念网络(DBN)、ResNet、VGGNet、AlexNet、视觉Transformer(ViT)和GoogLeNet。
引用
@article{arxiv.2307.13962,
title = {Understanding Deep Neural Networks via Linear Separability of Hidden Layers},
author = {Chao Zhang and Xinyu Chen and Wensheng Li and Lixue Liu and Wei Wu and Dacheng Tao},
journal= {arXiv preprint arXiv:2307.13962},
year = {2023}
}