中文

层级特化优化:基于灵敏度的卷积层基搜索

计算机视觉与模式识别 2024-08-15 v2 机器学习 数值分析 数值分析

摘要

深度神经网络模型具有复杂的体系结构且存在过参数化问题。参数数量远超整个数据集,耗费资源较大。这使得其在不同设备上的应用受限。减少网络参数的数量有助于减小模型规模,但若方法不当,可能会导致网络质量下降。矩阵分解是一种减少模型参数的方法,将矩阵表示为较小矩阵的乘积。本文提出了一种新的方法,针对卷积层的权重应用矩阵分解。该方法的核心是并非训练所有卷积,而仅训练部分卷积(基卷积),将其余卷积表示为基卷积的线性组合。在 ResNet 系列模型和 CIFAR-10 数据集上的实验表明,基卷积不仅可以减小模型规模,还能加快网络的前向和反向传递。本文另一贡献是提出一种快速方法,用于选择网络子集中的层,在该子集中应用矩阵分解不会降低最终模型的质量。

关键词

引用

@article{arxiv.2408.06024,
  title  = {Layer-Specific Optimization: Sensitivity Based Convolution Layers Basis Search},
  author = {Vasiliy Alekseev and Ilya Lukashevich and Ilia Zharikov and Ilya Vasiliev},
  journal= {arXiv preprint arXiv:2408.06024},
  year   = {2024}
}

备注

Increase the size of matrix pictures for better UX in PDF view