中文

通过稠密跨层互蒸馏的知识迁移

计算机视觉与模式识别 2020-08-19 v1 机器学习

摘要

基于知识蒸馏(KD)的方法采用单向知识迁移(KT)方案,其中以预训练的高容量教师网络指导低容量学生网络的训练。近来,深度互学习(DML)提出了一种双向 KT 策略,表明学生网络亦有助于改进教师网络。本文中,我们提出稠密跨层互蒸馏(DCM),一种改进的双向 KT 方法,其中教师与学生网络从零开始协同训练。为增强知识表示学习,向教师与学生网络的某些隐藏层添加精心设计的辅助分类器。为提升 KT 性能,我们在附加分类器的层之间引入稠密双向 KD 操作。训练后所有辅助分类器被丢弃,从而最终模型未引入额外参数。我们在多种 KT 任务上测试了该方法,显示出相对于相关方法的优越性。代码见 https://github.com/sundw2014/DCM

关键词

引用

@article{arxiv.2008.07816,
  title  = {Knowledge Transfer via Dense Cross-Layer Mutual-Distillation},
  author = {Anbang Yao and Dawei Sun},
  journal= {arXiv preprint arXiv:2008.07816},
  year   = {2020}
}

备注

Accepted by ECCV 2020. The code is available at https://github.com/sundw2014/DCM, which is based on the implementation of our DKS work https://github.com/sundw2014/DKS