用于知识蒸馏的多粒度方法
计算机视觉与模式识别
2021-09-06 v1
摘要
考虑到学生理解教师所传授知识的能力各不相同,提出了一种多粒度蒸馏机制,以向学生网络迁移更易理解的知识。设计了一种教师网络的多粒度自分析模块,使学生网络能够从不同的教学模式中学习知识。此外,提出了一种稳定激励方案,用于对学生训练进行鲁棒监督。所提出的蒸馏机制可嵌入作为基线的不同蒸馏框架中。实验表明,该机制在基线上平均提高准确率0.58%,最佳情况下提高1.08%,其性能优于当前最优方法(state-of-the-art, SOTA)。研究还发现,该机制可提升学生对带噪输入的微调能力与鲁棒性。代码见 https://github.com/shaoeric/multi-granularity-distillation。
引用
@article{arxiv.2108.06681,
title = {Multi-granularity for knowledge distillation},
author = {Baitan Shao and Ying Chen},
journal= {arXiv preprint arXiv:2108.06681},
year = {2021}
}
备注
14 pages, 12 figures