中文

打开黑箱:利用重建熵预测深度神经网络的可训练性

机器学习 2024-12-23 v3 无序系统与神经网络 高能物理 - 理论 机器学习

摘要

机器学习中的一个重要挑战是预测给定神经网络在何种初始条件下是可训练的。我们提出了一种方法,用于预测深度前馈神经网络(DNN)在参数空间中的可训练区域,该方法通过一系列单层辅助网络级联,从后续激活层重建输入。我们表明,对浅层级联网络进行单个周期的训练就足以预测深度前馈网络在一系列数据集(MNIST、CIFAR10、FashionMNIST和白噪声)上的可训练性,从而显著减少总体训练时间。我们通过计算重建图像与原始输入之间的相对熵来实现这一点,并表明这种信息丢失探针对网络的相行为敏感。我们进一步证明了该方法可以推广到残差神经网络(ResNet)和卷积神经网络(CNN)。此外,我们的方法通过展示网络在每一层对输入数据所做的更改,阐明了网络的决策过程,我们分别对在MNIST上训练的DNN和在ImageNet数据集上训练的vgg16 CNN进行了演示。我们的结果为显著加速大型神经网络的训练提供了一种技术。

关键词

引用

@article{arxiv.2406.12916,
  title  = {Opening the Black Box: predicting the trainability of deep neural networks with reconstruction entropy},
  author = {Yanick Thurn and Ro Jefferson and Johanna Erdmenger},
  journal= {arXiv preprint arXiv:2406.12916},
  year   = {2024}
}

备注

29 pages, 10 figures, 1 table, new examples for CNNs and ResNet added, Vgg16 example in xai section added