揭开知识蒸馏的神秘面纱:基于残差网络的视角
计算机视觉与模式识别
2020-07-01 v1
摘要
知识蒸馏(KD)通常被视为一种模型压缩与学得标签平滑的技术。然而,在本文中,我们从一个新视角研究并考察 KD 方法:我们研究其在不使用任何残差连接训练更深网络时的有效性。我们发现,在大多数情况下,非残差学生网络的表现与在原始数据上训练且无 KD 的残差版本(基线网络)相当或更好。令人惊讶的是,在某些情况下,即便教师网络较差,它们也超越了基线网络的精度。在非残差学生网络达到一定深度后,因移除残差连接带来的精度下降是显著的,而使用 KD 训练能大幅提升学生网络的精度;不过,它并不能完全弥补精度下降。此外,我们观察到 KD 传统的师生观点是不完整的,无法充分解释我们的发现。我们提出一种以受训者-导师假设(Trainee-Mentor hypothesis)对 KD 的新诠释,提供了对 KD 的整体视角。我们还给出损失景观与特征复用两个观点,以解释残差连接与 KD 之间的相互作用。我们通过残差网络上的大量实验证实了我们的主张。
引用
@article{arxiv.2006.16589,
title = {On the Demystification of Knowledge Distillation: A Residual Network Perspective},
author = {Nandan Kumar Jha and Rajat Saini and Sparsh Mittal},
journal= {arXiv preprint arXiv:2006.16589},
year = {2020}
}