基于自适应实例归一化的知识蒸馏
计算机视觉与模式识别
2020-03-11 v1 机器学习
摘要
本文解决通过知识蒸馏进行模型压缩的问题。为此,我们提出了一种基于迁移特征统计量(具体为通道均值和方差)从教师网络到学生网络的新知识蒸馏方法。我们的方法超越了通过 损失强制学生网络的均值和方差与教师网络相似的标准方式,我们发现该标准方式效果有限。具体而言,我们提出了一种基于自适应实例归一化的新损失,以有效迁移特征统计量。其主要思想是通过自适应实例归一化(以学生为条件)将学习到的统计量传回教师网络,并让教师网络通过损失来“评估”学生学到的统计量是否被可靠迁移。我们表明,在包括不同(a)网络架构、(b)师生容量、(c)数据集和(d)领域的大量实验设置下,我们的蒸馏方法优于其他最先进蒸馏方法。
引用
@article{arxiv.2003.04289,
title = {Knowledge distillation via adaptive instance normalization},
author = {Jing Yang and Brais Martinez and Adrian Bulat and Georgios Tzimiropoulos},
journal= {arXiv preprint arXiv:2003.04289},
year = {2020}
}