通过构建双向映射与动态教师的保持间隙蒸馏
计算机视觉与模式识别
2024-10-08 v1
摘要
知识蒸馏旨在将来自大型教师模型的知识传递给紧凑的学生模型,通常会导致两者之间存在显著的性能差距。我们发现过大的性能差距会阻碍训练过程,这也得到了最近研究的验证。为解决这一问题,我们提出了一种保持间隙蒸馏(GPD)方法,该方法在训练学生的同时从零开始训练一个额外的动态教师模型,以桥接这一差距。如此一来,就可以在整个蒸馏过程中维持教师和学生之间合理的性能差距。为了进一步加强来自动态教师的蒸馏,我们开发了一种硬策略,通过强制他们共享参数并鼓励参数继承。除了硬策略,我们还在动态教师和学生之间构建软双向映射,这些映射基于逆重参数化(IR)方法和通道分支重参数化(CBR)策略构建。我们指出,IR 能够以任意扩展比率初始化更大的动态教师,同时保持与给定学生模型完全相同的准确率。如此一来,我们保证动态教师和学生从同一点开始,避免在训练早期出现过大的差距。至于我们的 CBR,由于参数共享,它直接从已学习的动态教师中提取有效的学生模型,而无需后训练,使该方法在模型部署方面具有高度灵活性。在实验中,GPD 在 CNN 和 transformer 架构上显著优于现有蒸馈方法,实现了最高可达 1.58% 的准确率提升。有趣的是,GPD 也能良好地适用于没有预训练教师的场景,包括从头训练和微调,分别实现了在 ResNet18 上的 1.80% 和 0.89% 的显著提升。
引用
@article{arxiv.2410.04140,
title = {Gap Preserving Distillation by Building Bidirectional Mappings with A Dynamic Teacher},
author = {Yong Guo and Shulian Zhang and Haolin Pan and Jing Liu and Yulun Zhang and Jian Chen},
journal= {arXiv preprint arXiv:2410.04140},
year = {2024}
}
备注
10 pages for the main paper