数据高效的阶段式知识蒸馏
机器学习
2020-06-24 v3 计算机视觉与模式识别
摘要
尽管深度学习(DL)取得了成功,但现代DL模型部署所需的大量计算能力对资源受限系统构成了显著问题。这需要构建在保持性能的同时减少计算的紧凑网络。传统知识蒸馏(KD)方法将知识从教师网络传递给学生网络时,(a)使用单阶段,(b)在蒸馏知识给学生网络时需要整个数据集。在本文中,我们提出一种称为阶段式知识蒸馏(SKD)的新方法,该方法基于传统KD方法,通过渐进式阶段训练来利用从教师网络获得的知识,从而实现数据高效的蒸馏过程。我们在分类与语义分割任务上评估了我们的方法。我们在所测试的任务中表明,即使仅使用蒸馏中数据的一小部分,也能获得显著的性能提升,且不损害指标。我们还将我们的方法与现有KD技术进行比较,表明SKD优于它们。此外,我们的方法可视为一种通用模型压缩技术,可补充量化或剪枝等其他模型压缩方法。
引用
@article{arxiv.1911.06786,
title = {Data Efficient Stagewise Knowledge Distillation},
author = {Akshay Kulkarni and Navid Panchi and Sharath Chandra Raparthy and Shital Chiddarwar},
journal= {arXiv preprint arXiv:1911.06786},
year = {2020}
}
备注
15 pages, 1 figure, 6 tables and 1 algorithm