Generative Denoise Distillation: Simple Stochastic Noises Induce Efficient Knowledge Transfer for Dense Prediction
计算机视觉与模式识别
2024-01-18 v2
摘要
知识蒸馏是将知识从更强大的大模型(教师)转移到更简单的对应模型(学生)的过程。众多现有方法涉及学生直接模仿教师的知识。然而,通过这些流行方法学到的表示中仍存在冗余,它们倾向于不加区分地学习每个空间位置的特征。为了从教师模型中导出更紧凑的表示(概念特征),受人类认知启发,我们提出了一种创新方法,称为生成去噪蒸馏(GDD),其中随机噪声被添加到学生的概念特征中,以将其嵌入到由浅层网络生成的实例特征中。然后,将生成的实例特征与教师的实例知识对齐。我们在目标检测、实例分割和语义分割上进行了广泛实验,以展示我们方法的多功能性和有效性。值得注意的是,GDD 在上述任务中取得了新的 state-of-the-art 性能。通过增强基于 ResNet-18 的 PspNet 和 DeepLabV3,我们在语义分割方面取得了显著提升,mIoU 分数分别达到 74.67 和 77.69,超过了它们在 20 类 Cityscapes 数据集上此前 69.85 和 73.20 的分数。源代码可在 https://github.com/ZhgLiu/GDD 获取。
引用
@article{arxiv.2401.08332,
title = {Generative Denoise Distillation: Simple Stochastic Noises Induce Efficient Knowledge Transfer for Dense Prediction},
author = {Zhaoge Liu and Xiaohao Xu and Yunkang Cao and Weiming Shen},
journal= {arXiv preprint arXiv:2401.08332},
year = {2024}
}