中文

Prune-Quantize-Distill:高效神经网络压缩的有序管道

机器学习 2026-04-10 v1 人工智能 计算与语言

摘要

现代部署往往需要在 CPU 和内存限制紧张的情况下在准确率和效率之间进行权衡,但常见的压缩代理(如参数数量或 FLOPs)并不能可靠地预测实际的墙钟推理时间。特别是,无结构稀疏性虽然可以减少模型存储,但在标准 CPU 执行中可能无法加速(甚至可能略微减慢),因为不规则的内存访问和稀疏内核开销。为了弥合压缩与加速之间的这一差距,我们研究了一条面向实际测量延迟的有序管道,该管道综合运用了三种广泛使用的方法:无结构剪枝、INT8 量化感知训练 (QAT) 和知识蒸馏 (KD)。经验上,INT8 QAT 提供了主要的运行时收益,而剪枝主要充当容量降低的预条件器,以提高后续低精度优化的鲁棒性;KD 则在已受限的稀疏 INT8 范围内恢复准确率,而不改变部署形式。我们在 CIFAR-10/100 上进行评估,使用三种主干网络 (ResNet-18、WRN-28-10 和 VGG-16-BN)。在所有设置下,所提出的有序管道均实现了比任何单一技术单独使用的更强的准确率-大小-延迟前沿,达到 0.99-1.42 ms 的 CPU 延迟,同时保持竞争的准确率和紧凑的检查点。受控的排序消融实验(在固定 20/40/40 epoch 分配下)进一步确认,阶段顺序具有重要意义,所提出的顺序在所测试的各种排列中通常表现最佳。总体而言,我们的结果为边缘部署提供了一个简单的指南:应使用测量的运行时评估压缩选择,而非仅依赖代理指标。

关键词

引用

@article{arxiv.2604.04988,
  title  = {Prune-Quantize-Distill: An Ordered Pipeline for Efficient Neural Network Compression},
  author = {Longsheng Zhou and Yu Shen},
  journal= {arXiv preprint arXiv:2604.04988},
  year   = {2026}
}

备注

7 pages, submitted to IJCNN