深度学习模型可学习参数的可学习性
机器学习
2024-08-22 v1 计算机视觉与模式识别
摘要
我们细致审查了深度学习模型的结构和操作方面,特别关注可学习参数(权重)统计、分布、节点相互作用以及可视化等细微差别。通过建立权重模式方差与整体网络性能之间的相关性,我们探讨了各种深度学习模型在不同情况下(最优和次优)的性能差异。我们的实证分析涵盖了广为人知的数据集,如MNIST、Fashion-MNIST和CIFAR-10,以及各种深度学习模型,如深度神经网络(DNNs)、卷积神经网络(CNNs)和视觉Transformer(ViT),从而确定了与成功网络相关的可学习参数特征。通过对各种深度学习模型架构进行大量实验,我们揭示了影响深度神经网络功能和效率的关键因素。我们的发现表明,无论数据集或模型如何,成功的网络在其收敛权重统计和分布方面始终类似于其他成功的网络,而表现不佳的网络在权重方面则有所不同。此外,我们的研究显示,广泛变异的深度学习模型,如DNN、CNN和ViT的可学习参数都具有相似的学习特征。
引用
@article{arxiv.2408.11720,
title = {On Learnable Parameters of Optimal and Suboptimal Deep Learning Models},
author = {Ziwei Zheng and Huizhi Liang and Vaclav Snasel and Vito Latora and Panos Pardalos and Giuseppe Nicosia and Varun Ojha},
journal= {arXiv preprint arXiv:2408.11720},
year = {2024}
}