通过标签平滑正则化重访知识蒸馏
计算机视觉与模式识别
2021-03-05 v3 机器学习
摘要
知识蒸馏(KD)旨在将繁琐教师模型的知识蒸馏到轻量级学生模型中。其成功通常归因于教师模型提供的关于类别间相似性的特权信息,并且在这种意义上,实践中仅部署强教师模型来教导较弱的学生。在这项工作中,我们通过以下实验观察挑战这一常见信念:1)除了承认教师能提升学生外,学生也可以通过逆转 KD 过程显著增强教师;2)准确率远低于学生的训练不佳教师仍可以显著改善后者。为解释这些观察,我们提供了 KD 与标签平滑正则化之间关系的理论分析。我们证明:1)KD 是一种学习到的标签平滑正则化;2)标签平滑正则化为 KD 提供了虚拟教师模型。基于这些结果,我们认为 KD 的成功并非完全来自教师的类别间相似性信息,也来自软目标的正则化,其同等甚至更加重要。基于这些分析,我们进一步提出一种新颖的无教师知识蒸馏(Tf-KD)框架,其中学生模型从自身或手动设计的正则化分布中学习。Tf-KD 取得了与来自优越教师的普通 KD 相当的性能,在更强教师模型不可用时得到很好应用。同时,Tf-KD 是通用的,可直接用于训练深度神经网络。在没有任何额外计算成本的情况下,Tf-KD 在 ImageNet 上比较成熟的基线模型提升了高达 0.65\%,优于标签平滑正则化。
引用
@article{arxiv.1909.11723,
title = {Revisiting Knowledge Distillation via Label Smoothing Regularization},
author = {Li Yuan and Francis E. H. Tay and Guilin Li and Tao Wang and Jiashi Feng},
journal= {arXiv preprint arXiv:1909.11723},
year = {2021}
}
备注
CVPR2020 Oral, codes: https://github.com/yuanli2333/Teacher-free-Knowledge-Distillation