中文

面向增量式隐式细化分类的多教师知识蒸馏

计算机视觉与模式识别 2022-02-25 v2

摘要

增量学习方法可以在序列学习过程中通过将知识从上一模型(作为教师模型)蒸馏到当前模型(作为学生模型)来持续学习新类。然而,这些方法无法用于增量式隐式细化分类(IIRC)——一种增量学习扩展,其中新到来的类可能具有两个粒度层级,即超类标签与子类标签。这是因为先前学到的超类知识可能被顺序学到的子类知识所占据。为解决此问题,我们提出一种新颖的多教师知识蒸馏(MTKD)策略。为保留子类知识,我们使用上一模型作为通用教师,为学生模型蒸馏先前知识。为保留超类知识,我们使用初始模型作为超类教师来蒸馏超类知识,因为初始模型包含丰富的超类知识。然而,从两个教师模型蒸馏知识可能导致学生模型产生一些冗余预测。我们进一步提出一种称为 Top-k 预测限制的后处理机制,以减少冗余预测。我们在 IIRC-ImageNet120 与 IIRC-CIFAR100 上的实验结果表明,与现有最先进方法相比,所提方法能取得更好的分类准确率。

关键词

引用

@article{arxiv.2202.11384,
  title  = {Multi-Teacher Knowledge Distillation for Incremental Implicitly-Refined Classification},
  author = {Longhui Yu and Zhenyu Weng and Yuqing Wang and Yuesheng Zhu},
  journal= {arXiv preprint arXiv:2202.11384},
  year   = {2022}
}