中文

使用多个教师助理的密集引导知识蒸馏

计算机视觉与模式识别 2021-08-10 v3

摘要

随着深度神经网络的成功,引导小体量学生网络从大体量教师网络学习的知识蒸馏正被积极研究用于模型压缩与迁移学习。然而,当学生与教师模型规模差异显著时,针对学生网络学习不佳问题的研究甚少。在本文中,我们提出一种使用多个教师助理的密集引导知识蒸馏,其逐步减小模型规模,以高效弥合教师与学生网络间的巨大差距。为促进学生网络更高效学习,我们迭代地将每个教师助理引导至其他更小的教师助理。具体而言,在下一步教导更小的教师助理时,除教师网络外还使用上一步已有的更大的教师助理。此外,我们设计了随机教学:在每个 mini-batch 中,随机丢弃教师或教师助理。这充当正则化器以提升学生网络的教学效率。因此,学生总能从多源学习到显著的蒸馏知识。我们使用 CIFAR-10、CIFAR-100 和 ImageNet 在分类任务上验证了所提方法的有效性。我们还通过 ResNet、WideResNet 和 VGG 等多种骨干架构取得了显著的性能提升。

关键词

引用

@article{arxiv.2009.08825,
  title  = {Densely Guided Knowledge Distillation using Multiple Teacher Assistants},
  author = {Wonchul Son and Jaemin Na and Junyong Choi and Wonjun Hwang},
  journal= {arXiv preprint arXiv:2009.08825},
  year   = {2021}
}

备注

Accepted at ICCV 2021