中文

更好的教师更好的学生:用于知识蒸馏的动态先验知识

计算机视觉与模式识别 2023-03-24 v4

摘要

知识蒸馏(KD)在将大型模型(教师)的学习表征迁移到小型模型(学生)方面已展现出极具前景的能力。然而,当学生与教师之间的容量差距变大时,现有KD方法无法取得更好结果。我们的工作表明,“先验知识”对KD至关重要,尤其是在使用大型教师模型时。具体而言,我们提出动态先验知识(DPK),在特征蒸馏前将教师部分特征作为先验知识整合。这意味着我们的方法还将教师特征作为“输入”而非仅作为“目标”。此外,我们在训练阶段根据特征差距动态调整先验知识的比例,从而以适当难度引导学生。为评估所提方法,我们在两个图像分类基准(即CIFAR100和ImageNet)以及一个目标检测基准(即MS COCO)上进行了大量实验。结果证明了我们的方法在不同设置下性能的优越性。此外,我们的DPK使学生模型性能与教师模型性能正相关,这意味着我们可以通过应用更大的教师模型进一步提升学生准确率。更重要的是,DPK为任意给定模型提供了教师模型选择的快速方案。

关键词

引用

@article{arxiv.2206.06067,
  title  = {Better Teacher Better Student: Dynamic Prior Knowledge for Knowledge Distillation},
  author = {Zengyu Qiu and Xinzhu Ma and Kunlin Yang and Chunya Liu and Jun Hou and Shuai Yi and Wanli Ouyang},
  journal= {arXiv preprint arXiv:2206.06067},
  year   = {2023}
}

备注

ICLR'23 accepted