ViTKD:ViT特征知识蒸馏的实用准则
计算机视觉与模式识别
2022-09-07 v1
摘要
卷积神经网络(CNN)的知识蒸馏(KD)作为提升小模型性能的方法已被广泛研究。近来,视觉Transformer(ViT)在许多计算机视觉任务上取得巨大成功,ViT的知识蒸馏也备受期待。然而,除基于输出logit的KD外,CNN的其他基于特征的知识蒸馏方法因巨大的结构差异无法直接应用于ViT。本文探索ViT基于特征的蒸馏方式。基于ViT中特征图的本质,我们设计了一系列对照实验并得出三条ViT特征蒸馏的实用准则。其中一些发现甚至与CNN时代的做法相反。基于这三条准则,我们提出基于特征的方法ViTKD,为学生模型带来一致且可观的提升。在ImageNet-1k上,我们将DeiT-Tiny从74.42%提升至76.06%,DeiT-Small从80.55%提升至81.95%,DeiT-Base从81.76%提升至83.46%。此外,ViTKD与基于logit的KD方法互补,可直接联合使用。该组合可进一步提升学生性能:具体而言,学生DeiT-Tiny、Small与Base分别达到77.78%、83.59%与85.41%。代码见https://github.com/yzd-v/cls_KD。
引用
@article{arxiv.2209.02432,
title = {ViTKD: Practical Guidelines for ViT feature knowledge distillation},
author = {Zhendong Yang and Zhe Li and Ailing Zeng and Zexian Li and Chun Yuan and Yu Li},
journal= {arXiv preprint arXiv:2209.02432},
year = {2022}
}
备注
5 figures; 9 tables