从知识蒸馏到自知识蒸馏:基于归一化损失与定制软标签的统一方法
计算机视觉与模式识别
2023-07-18 v2
摘要
知识蒸馏(KD)利用教师的预测logits作为软标签来引导学生,而自知识蒸馏(self-KD)不需要真实教师来提供软标签。本工作通过将通用KD损失分解重组为归一化KD(NKD)损失以及针对目标类(图像类别)和非目标类的定制软标签(称为通用自知识蒸馏,USKD),统一了这两类任务的表述。我们分解KD损失,发现其中的非目标损失迫使学生非目标logits匹配教师,但两个非目标logits之和不同,阻碍其完全一致。NKD对非目标logits进行归一化以使之和相等,可普遍用于KD和self-KD以更好地利用软标签计算蒸馏损失。USKD在无教师情况下为目标类和非目标类生成定制软标签:将学生目标logit平滑作为软目标标签,并利用中间特征的秩结合齐夫定律(Zipf's law)生成软非目标标签。对于有教师的KD,我们的NKD在CIFAR-100和ImageNet数据集上取得最优性能,以ResNet-34为教师将ResNet18的ImageNet Top-1准确率从69.90%提升至71.96%。对于无教师的self-KD,USKD是首个可有效应用于CNN和ViT模型且额外时间与内存开销可忽略的自KD方法,取得新的最优结果,如MobileNet和DeiT-Tiny在ImageNet上分别提升1.17%和0.55%准确率。代码见https://github.com/yzd-v/cls_KD。
引用
@article{arxiv.2303.13005,
title = {From Knowledge Distillation to Self-Knowledge Distillation: A Unified Approach with Normalized Loss and Customized Soft Labels},
author = {Zhendong Yang and Ailing Zeng and Zhe Li and Tianke Zhang and Chun Yuan and Yu Li},
journal= {arXiv preprint arXiv:2303.13005},
year = {2023}
}
备注
Accepted by ICCV 2023