面向密集预测的通道级知识蒸馏
计算机视觉与模式识别
2021-08-30 v4
摘要
知识蒸馏(KD)已被证明是训练紧凑模型的一种简单而有效的工具。几乎所有用于密集预测任务的 KD 变体都在空间域中对齐学生与教师网络的特征图,通常通过点式和/或成对差异的最小化来实现。观察到在语义分割中,某些层的各通道特征激活倾向于编码场景类别的显著性(类似于类激活映射),我们提出在学生与教师网络之间按通道对齐特征。为此,我们首先使用 softmax 归一化将每个通道的特征图转换为概率图,然后最小化两网络对应通道的 Kullback-Leibler(KL)散度。通过这种方式,我们的方法侧重于模仿通道间的软分布。特别地,KL 散度使得学习更加关注通道级映射中最显著的区域,这些区域大概对应于语义分割中最有用的信号。实验表明,我们的通道级蒸馏在语义分割上大幅优于几乎所有现有的空间蒸馏方法,且在训练时所需计算成本更低。我们在三个基准上以多种网络结构一致地取得了优越性能。代码见:https://git.io/Distiller
引用
@article{arxiv.2011.13256,
title = {Channel-wise Knowledge Distillation for Dense Prediction},
author = {Changyong Shu and Yifan Liu and Jianfei Gao and Zheng Yan and Chunhua Shen},
journal= {arXiv preprint arXiv:2011.13256},
year = {2021}
}
备注
Accepted to Proc. Int. Conf. Computer Vision (ICCV) 2021. Code is available at: https://git.io/Distiller