中文

基于上下文感知知识蒸馏的教师引导单次剪枝

计算机视觉与模式识别 2025-11-21 v1 人工智能

摘要

非结构化剪枝是压缩深度神经网络的强大策略,但往往需要迭代的 train-prune-retrain 循环,导致计算开销巨大。为此,我们提出一种新型教师引导式剪枝框架,将知识蒸馏 (Knowledge Distillation, KD) 与重要性得分估计紧密集成。不同于以往将 KD 作为剪枝后恢复步骤的做法,我们的方法利用由教师提供的梯度信号,以增强对任务性能和知识传输至关重要的参数的重要性得分计算,从而识别并保留这些关键参数。我们的框架实现了单次全局剪枝策略,高效地消除冗余权重,同时保留关键表征。剪枝后,我们采用稀疏感知式再训练(带或不带 KD),在不重新激活被剪枝连接的情况下恢复准确率。广泛的实验表明,在包括 CIFAR-10、CIFAR-100 和 TinyImageNet 在内的多个图像分类基准中,我们的方法在保持最小性能退化的同时,始终实现高稀疏度。值得注意的是,我们的方法在高稀疏度水平下优于 EPG 和 EPSD 等最新基线方法,同时相较于 COLT 等迭代式剪枝方案,计算更为高效。该框架提供了一种计算高效、性能可保留的解决方案,适用于资源受限的部署环境。

关键词

引用

@article{arxiv.2511.16653,
  title  = {Teacher-Guided One-Shot Pruning via Context-Aware Knowledge Distillation},
  author = {Md. Samiul Alim and Sharjil Khan and Amrijit Biswas and Fuad Rahman and Shafin Rahman and Nabeel Mohammed},
  journal= {arXiv preprint arXiv:2511.16653},
  year   = {2025}
}

备注

Accepted at 2025 IEEE International Conference on Big Data (IEEE BigData 2025)