面向视觉Transformer的累积空间知识蒸馏
计算机视觉与模式识别
2023-07-18 v1
摘要
从卷积神经网络(CNN)中蒸馏知识对于视觉Transformer(ViT)而言是一把双刃剑。它提升了性能,因为CNN对图像友好的局部归纳偏置有助于ViT更快更好地学习,但也导致了两个问题:(1)CNN与ViT的网络设计完全不同,导致中间特征的语义层次不同,使得空间级知识迁移方法(如特征模仿)效率低下。(2)从CNN蒸馏知识限制了网络在训练后期的收敛,因为ViT整合全局信息的能力受到CNN局部归纳偏置监督的抑制。为此,我们提出累积空间知识蒸馏(CSKD)。CSKD将CNN对应空间响应的空间级知识蒸馏到ViT的所有patch token上,而不引入中间特征。此外,CSKD利用一个累积知识融合(CKF)模块,该模块引入CNN的全局响应并在训练过程中逐步增强其重要性。应用CKF可在训练前期利用CNN的局部归纳偏置,并在后期充分发挥ViT的全局能力。在ImageNet-1k及下游数据集上的大量实验与分析证明了我们CSKD的优越性。代码将公开可用。
引用
@article{arxiv.2307.08500,
title = {Cumulative Spatial Knowledge Distillation for Vision Transformers},
author = {Borui Zhao and Renjie Song and Jiajun Liang},
journal= {arXiv preprint arXiv:2307.08500},
year = {2023}
}
备注
Accepted by ICCV 2023