中文

通过正则化特征范数与方向改进知识蒸馏

计算机视觉与模式识别 2023-05-29 v1

摘要

知识蒸馏(KD)利用一个大型训练好的模型(即教师模型)在同一数据集上针对相同任务训练一个小规模学生模型。将教师特征视为知识,主流 KD 方法通过使学生特征与教师特征对齐来训练学生,例如最小化两者 logits 之间的 KL 散度或中间特征之间的 L2 距离。尽管自然认为学生特征与教师特征更好对齐能更好地蒸馏教师知识,但简单强制这种对齐并不能直接提升学生性能,例如分类精度。在本文中,我们提出将学生特征与教师特征的类均值对齐,其中类均值天然充当强分类器。为此,我们探索了基线技术,如采用基于余弦距离的损失来鼓励学生特征与其对应教师类均值之间的相似性。此外,受其他工作线(如模型剪枝和域适应)启发,我们训练学生产生大范数特征,这些工作发现大范数特征更具显著性。最后,我们提出一个相当简单的损失项(称为 ND 损失)来同时(1)鼓励学生产生大范数(\emph{norm})特征,以及(2)对齐学生特征与教师类均值的\emph{方向}(\emph{direction})。在标准基准上的实验表明,我们探索的技术帮助现有 KD 方法取得更好性能,即在 ImageNet 和 CIFAR100 数据集上更高的分类精度,以及在 COCO 数据集上更高的检测精度。重要的是,我们提出的 ND 损失帮助最大,在这些基准上达到了最先进性能。源代码见于 \url{https://github.com/WangYZ1608/Knowledge-Distillation-via-ND}。

关键词

引用

@article{arxiv.2305.17007,
  title  = {Improving Knowledge Distillation via Regularizing Feature Norm and Direction},
  author = {Yuzhu Wang and Lechao Cheng and Manni Duan and Yongheng Wang and Zunlei Feng and Shu Kong},
  journal= {arXiv preprint arXiv:2305.17007},
  year   = {2023}
}

备注

16 pages, 8 figures, 6 tables