中文

动态校正知识蒸馏

计算机视觉与模式识别 2022-01-28 v1 人工智能

摘要

知识蒸馏是一种旨在利用暗知识将信息从庞大且训练良好的神经网络(教师模型)压缩并迁移至更小、能力较弱的神经网络(学生模型)以提升推理效率的技术。由于此类笨重模型部署于边缘计算设备时极为复杂,这种蒸馏知识的方法已广受欢迎。一般而言,用于教导较小学生模型的教师模型本身笨重且训练代价高昂。为彻底消除对笨重教师模型的需求,我们提出了一种简洁而有效的知识蒸馏框架,称之为动态校正知识蒸馏 (DR-KD)。我们的方法将学生转化为自身的教师,若自教师在蒸馏信息时出现错误预测,则在知识被蒸馏前予以校正。具体而言,在传统训练所获知识的蒸馏过程中,教师目标由真实标签动态微调。所提 DR-KD 在缺乏复杂笨重教师模型时表现优异,并以低代价动态教师实现时,取得了与现有最先进无教师知识蒸馏框架相当的性能。我们的方法具有普适性,可用于任何需要分类或目标识别的深度神经网络训练。DR-KD 在 Tiny ImageNet 上相较显著基线模型将测试准确率提升 2.65%,优于任何其他知识蒸馏方法且无需额外训练成本。

关键词

引用

@article{arxiv.2201.11319,
  title  = {Dynamic Rectification Knowledge Distillation},
  author = {Fahad Rahman Amik and Ahnaf Ismat Tasin and Silvia Ahmed and M. M. Lutfe Elahi and Nabeel Mohammed},
  journal= {arXiv preprint arXiv:2201.11319},
  year   = {2022}
}