中文

ERDE:用于早期退出的熵正则化蒸馏

计算机视觉与模式识别 2025-10-07 v1 机器学习

摘要

虽然深度神经网络,特别是卷积神经网络在图像分类中展现出以色准的性能,但仍具有较高的计算成本,往往难以用于实时和边缘计算应用。因此,已developed多种压缩技术以降低成本,同时保持准确率。此外,还引入了动态架构以在执行时调节压缩程度,这在许多资源受限的应用场景中是理想的属性。本方法有效地集成了两种成熟的优化技术:早期退出和知识蒸馏,其中较简单的教师早期退出模型训练的减少学生早期退出模型。本研究的主要贡献在于学生早期退出模型的训练方法。与常规知识蒸馏损失相比,我们的方法融合了一种用于教师分类错误的图像的新的熵基损失。该方法优化了准确率与效率之间的权衡,从而在不损害分类性能的前提下显著降低计算复杂度。该方法的有效性通过在 CIFAR10、CIFAR100 和 SVHN 图像分类数据集上的实验结果得到验证,进一步开启了知识蒸馏在其他情境下的新研究视角。

关键词

引用

@article{arxiv.2510.04856,
  title  = {ERDE: Entropy-Regularized Distillation for Early-exit},
  author = {Martial Guidez and Stefan Duffner and Yannick Alpou and Oscar Röth and Christophe Garcia},
  journal= {arXiv preprint arXiv:2510.04856},
  year   = {2025}
}