中文

通过交叉熵重新思考知识蒸馏

计算机视觉与模式识别 2022-08-23 v1

摘要

知识蒸馏(KD)已得到广泛发展并推动了各类任务。经典的KD方法将KD损失加到原始交叉熵(CE)损失上。我们尝试分解KD损失以探索其与CE损失的关系。令人惊讶的是,我们发现它可视为CE损失与一个额外损失的组合,该额外损失与CE损失形式相同。然而,我们注意到额外损失迫使学生模型的相对概率去学习教师模型的绝对概率。此外,两者概率之和不同,导致难以优化。为解决此问题,我们修正了公式并提出了一种分布式损失。另外,我们利用教师模型的目标输出作为软目标,提出了软损失。结合软损失与分布式损失,我们提出了一种新的KD损失(NKD)。进一步地,我们平滑学生模型的目标输出将其作为无教师训练时的软目标,并提出了无教师的新KD损失(tf-NKD)。我们的方法在 CIFAR-100 和 ImageNet 上取得了最先进的性能。例如,以 ResNet-34 为教师模型,我们将 ResNet18 的 ImageNet Top-1 准确率从 69.90% 提升至 71.96%。在无教师训练中,MobileNet、ResNet-18 和 SwinTransformer-Tiny 分别达到 70.04%、70.76% 和 81.48%,较基线分别高出 0.83%、0.86% 和 0.30%。代码见 https://github.com/yzd-v/cls_KD。

关键词

引用

@article{arxiv.2208.10139,
  title  = {Rethinking Knowledge Distillation via Cross-Entropy},
  author = {Zhendong Yang and Zhe Li and Yuan Gong and Tianke Zhang and Shanshan Lao and Chun Yuan and Yu Li},
  journal= {arXiv preprint arXiv:2208.10139},
  year   = {2022}
}

备注

2 figures, 8 tables