中文

基于即时原生集成的知识蒸馏

计算机视觉与模式识别 2018-09-11 v2

摘要

知识蒸馏可有效训练小型且泛化的网络模型,以满足低内存和快速运行的要求。现有的离线蒸馏方法依赖于强大的预训练教师模型,其有利于知识发现与迁移,但需要复杂的两阶段训练过程。在线对应方法以缺乏高容量教师模型为代价解决了此限制。本工作中,我们提出一种用于单阶段在线蒸馏的即时原生集成(ONE)策略。具体而言,ONE仅训练单个多分支网络,同时即时建立强教师模型以增强目标网络的学习。大量评估表明,在CIFAR10、CIFAR100、SVHN和ImageNet四个图像分类数据集上,ONE比替代方法更显著地提升了多种深度神经网络的泛化性能,同时具有计算效率优势。

关键词

引用

@article{arxiv.1806.04606,
  title  = {Knowledge Distillation by On-the-Fly Native Ensemble},
  author = {Xu Lan and Xiatian Zhu and Shaogang Gong},
  journal= {arXiv preprint arXiv:1806.04606},
  year   = {2018}
}

备注

To appear in NIPS2018