中文

解耦知识蒸馏

计算机视觉与模式识别 2022-07-13 v2 人工智能

摘要

最先进的蒸馏方法主要基于从中间层蒸馏深层特征,而 logit 蒸馏的重要性被极大忽视。为提供研究 logit 蒸馏的新视角,我们将经典 KD 损失重新表述为两部分,即目标类知识蒸馏(TCKD)与非目标类知识蒸馏(NCKD)。我们经验性地研究并证明了这两部分的作用:TCKD 迁移关于训练样本“难度”的知识,而 NCKD 是 logit 蒸馏生效的主要原因。更重要的是,我们揭示经典 KD 损失是一种耦合表述,它(1)抑制了 NCKD 的有效性,且(2)限制了对这两部分进行平衡的灵活性。为解决这些问题,我们提出解耦知识蒸馏(DKD),使 TCKD 与 NCKD 能更高效、灵活地发挥作用。与复杂的基于特征的方法相比,我们的 DKD 在 CIFAR-100、ImageNet 和 MS-COCO 数据集上的图像分类与目标检测任务中取得了可比甚至更好的结果,并具有更好的训练效率。本文证明了 logit 蒸馏的巨大潜力,希望有助于未来研究。代码见 https://github.com/megvii-research/mdistiller。

关键词

引用

@article{arxiv.2203.08679,
  title  = {Decoupled Knowledge Distillation},
  author = {Borui Zhao and Quan Cui and Renjie Song and Yiyu Qiu and Jiajun Liang},
  journal= {arXiv preprint arXiv:2203.08679},
  year   = {2022}
}

备注

Accepted by CVPR2022, fix typo