中文

Mamba 基 PKD 用于高效知识压缩

机器学习 2025-10-07 v2

摘要

深度神经网络(DNN)在 various 图像处理任务中取得了显著的成功。然而,它们的大规模模型和计算复杂度为在资源受限的环境中部署它们带来了重大挑战。本文提出了一种创新方法,将 Mamba 架构集成到渐进式知识蒸馏(PKD)过程中,以解决在保持准确性的同时降低模型复杂度的挑战。该方法将一个大型教师模型蒸馏到一组逐渐变小的学生模型中,学生模型使用 Mamba 块设计。每个学生模型在 Mamba 块中使用选择状态空间模型(S-SSM),专注于重要输入方面,同时降低计算复杂度。该工作的初步实验使用 MNIST 和 CIFAR-10 数据集,演示了该方法的有效性。对于 MNIST,教师模型达到 98% 的准确率。一组七个学生模型保留了教师模型 63% 的 FLOPs,近似教师性能,达到 98% 的准确率。弱学生模型仅使用教师模型 1% 的 FLOPs,保持 72% 的准确率。同样地,对于 CIFAR-10,学生模型的准确率比教师模型低 1%,小学生模型保留教师模型 5% 的 FLOPs,达到 50% 的准确率。这些结果确认了 Mamba 架构的灵活性和可扩展性,它可以集成到 PKD 中,以成功找到弱学习者。该框架为在降低计算成本的同时将复杂神经网络部署到实际应用中提供了解决方案。

关键词

引用

@article{arxiv.2503.01727,
  title  = {Mamba base PKD for efficient knowledge compression},
  author = {José Medina and Amnir Hadachi and Paul Honeine and Abdelaziz Bensrhair},
  journal= {arXiv preprint arXiv:2503.01727},
  year   = {2025}
}

备注

A preliminary version of this work was presented as a short poster titled "Mamba-PKD: A Framework for Efficient and Scalable Model Compression in Image Classification" at The 40th ACM/SIGAPP Symposium on Applied Computing https://doi.org/10.1145/3672608.3707887