自适应多教师多层次知识蒸馏
计算机视觉与模式识别
2021-03-09 v1
摘要
知识蒸馏(KD)是一种有效的学习范式,通过利用从教师网络蒸馏出的额外监督知识来提升轻量级学生网络的性能。大多数开创性研究要么在其蒸馏学习方法中仅从单一教师学习,忽视了学生可同时从多位教师学习的潜力,要么简单地将每位教师视为同等重要,无法揭示不同教师对特定样本的不同重要性。为弥补这一差距,我们提出了一种新颖的自适应多教师多层次知识蒸馏学习框架(AMTML-KD),其包含两项新颖见解:(i) 将每位教师与潜表示相关联,以自适应地学习实例级教师重要性权重,并借此获取集成软目标(高层次知识);(ii) 通过所提多组提示策略,使中间级提示(中间层次知识)能够从多位教师处汇集。如此,学生模型便可通过 AMTML-KD 从多位教师学习多层次知识。在公开数据集上的大量结果表明,所提学习框架确保学生取得优于强劲竞争者的性能。
引用
@article{arxiv.2103.04062,
title = {Adaptive Multi-Teacher Multi-level Knowledge Distillation},
author = {Yuang Liu and Wei Zhang and Jun Wang},
journal= {arXiv preprint arXiv:2103.04062},
year = {2021}
}
备注
Neurocomputing 2020.07