中文

基于马尔科姆-帕斯图分布与正则化的深度神经网络剪枝

机器学习 2025-03-07 v2

摘要

深度神经网络(DNNs)近年来在图像识别、语音识别和自然语言处理等诸多应用领域取得了显著进展。尤其是视觉转换器(ViT)在深度学习图像分类领域已成为强大的模型类。本文提出一种基于随机矩阵理论(RMT)的新型 DNN 剪枝方法,基于权重和奇异向量的稀疏化,并将其应用于 ViT。RMT 为分析大型矩阵的统计属性提供了稳健框架,这已被证明对于理解和优化 DNN 的性能至关重要。我们展示了基于 RMT 的剪枝可用于减少 ViT 模型(在 ImageNet 上训练)的参数数量,降低 30-50%,而准确率损失不足 1%。据我们了解,这是目前针对这些 ViT 模型剪枝的最先进水平。此外,我们为上述数值研究提供了严密的数学依据,即我们为全连接 DNN 证明了一个定理,以及更一般的 DNN 结构,描述了在训练过程中,DNN 权重矩阵中的随机性随权重趋近局部或全局最小值而减小的规律。我们通过对全连接 DNN 进行数值实验验证了该定理,为理论发现提供了经验支持。此外,我们证明了一个描述 DNN 损失随权重层随机性减小时而减小的定理,并展示了损失减少量随我们移除的随机性 amount 呈单调依赖关系。我们的结果还为正则化在训练和剪枝中的作用提供了重要的 RMT 见解。

关键词

引用

@article{arxiv.2503.01922,
  title  = {Pruning Deep Neural Networks via a Combination of the Marchenko-Pastur Distribution and Regularization},
  author = {Leonid Berlyand and Theo Bourdais and Houman Owhadi and Yitzchak Shmalo},
  journal= {arXiv preprint arXiv:2503.01922},
  year   = {2025}
}