InDistill:用于模型压缩的信息流保持知识蒸馏
计算机视觉与模式识别
2025-01-23 v4
摘要
本文中,我们介绍InDistill,一种作为增强知识蒸馏(KD)有效性的预热阶段的方法。InDistill专注于将关键信息流路径从重量级教师模型迁移到轻量级学生模型。这是通过基于课程学习的训练方案实现的,该方案考虑了每一层的蒸馏难度以及建立信息流路径的关键学习期。此过程可得到更好准备从教师学习的学生模型。为确保InDistill在广泛师生对中的适用性,当教师与学生层宽度存在差异时,我们还引入了剪枝操作。该剪枝操作减小教师中间层宽度以匹配学生层,允许直接蒸馏而无需编码阶段。所提方法在CIFAR-10、CIFAR-100与ImageNet数据集上用多种师生架构广泛评估,表明保持信息流路径一致提升了基线KD方法在分类与检索设定下的性能。代码见 https://github.com/gsarridis/InDistill。
引用
@article{arxiv.2205.10003,
title = {InDistill: Information flow-preserving knowledge distillation for model compression},
author = {Ioannis Sarridis and Christos Koutlis and Giorgos Kordopatis-Zilos and Ioannis Kompatsiaris and Symeon Papadopoulos},
journal= {arXiv preprint arXiv:2205.10003},
year = {2025}
}