EPSD:结合自蒸馏的早期剪枝以实现高效模型压缩
机器学习
2024-02-02 v1 人工智能
计算机视觉与模式识别
摘要
神经网络压缩技术,如知识蒸馏(KD)和网络剪枝,已受到越来越多的关注。最近的工作“先剪枝,后蒸馏”揭示了一个经过剪枝的、对教师网络友好的学生网络可以提升KD的性能。然而,传统的教师-学生流程需要繁琐的教师预训练和复杂的压缩步骤,使得结合剪枝的KD效率较低。除了压缩模型,最近的压缩技术也强调效率方面。与传统剪枝方法相比,早期剪枝所需的计算成本显著降低,因为它不需要大型预训练模型。同样,KD的一个特例,即自蒸馏(SD),由于不需要预训练或选择师生对,因此效率更高。这启发我们将早期剪枝与SD相结合以实现高效的模型压缩。在这项工作中,我们提出了名为EPSD(Early Pruning with Self-Distillation)的框架,该框架在给定SD任务的早期剪枝中识别并保留可蒸馏的权重。EPSD通过两步过程有效地结合了早期剪枝和自蒸馏,保持了剪枝网络的可训练性以进行压缩。EPSD并非剪枝和SD的简单组合,而是通过在训练前保留更多可蒸馏权重,使剪枝网络有利于SD,从而确保剪枝网络得到更好的蒸馏。我们通过可视化和定量分析证明,EPSD改善了剪枝网络的训练。我们的评估涵盖了多种基准(CIFAR-10/100、Tiny-ImageNet、完整ImageNet、CUB-200-2011和Pascal VOC),EPSD的性能优于先进的剪枝和SD技术。
引用
@article{arxiv.2402.00084,
title = {EPSD: Early Pruning with Self-Distillation for Efficient Model Compression},
author = {Dong Chen and Ning Liu and Yichen Zhu and Zhengping Che and Rui Ma and Fachao Zhang and Xiaofeng Mou and Yi Chang and Jian Tang},
journal= {arXiv preprint arXiv:2402.00084},
year = {2024}
}
备注
The first two authors are with equal contributions. Paper accepted by AAAI 2024