提示动态知识蒸馏
计算机视觉与模式识别
2022-12-01 v1 机器学习
摘要
知识蒸馏(KD)将高容量教师模型中的知识迁移以提升更小的学生模型。现有工作通过匹配预测logits、特征嵌入等方式引导蒸馏,但对如何高效地联合利用它们探索较少。本文提出提示动态知识蒸馏(Hint-dynamic Knowledge Distillation,简称HKD),以动态方案从教师模型的提示(hints)中挖掘知识。知识提示的引导效果在不同实例与学习阶段通常各异,这促使我们为学生模型自适应地定制特定的提示学习方式。具体而言,引入一个元权重网络,在学生模型动态学习进度的感知下生成关于知识提示的实例级权重系数。我们进一步提出一种权重集成策略,利用历史统计量消除系数估计的潜在偏差。在CIFAR-100与Tiny-ImageNet标准基准上的实验表明,所提HKD良好地提升了知识蒸馏任务的效果。
引用
@article{arxiv.2211.17059,
title = {Hint-dynamic Knowledge Distillation},
author = {Yiyang Liu and Chenxin Li and Xiaotong Tu and Xinghao Ding and Yue Huang},
journal= {arXiv preprint arXiv:2211.17059},
year = {2022}
}
备注
5 pages