中文

大核卷积网络是否比 Transformer 更适合作为小核卷积网络的知识蒸馏教师?

计算机视觉与模式识别 2023-06-01 v1 人工智能

摘要

本文揭示了近期出现的大核卷积神经网络(ConvNets)的一种新价值:作为小核 ConvNets 在知识蒸馏(KD)中的教师模型。尽管 Transformer 凭借不断增大的模型和标注数据在各个领域取得了最先进(SOTA)性能,但小核 ConvNets 由于高效的卷积操作和紧凑的权值共享,被认为更适用于资源受限的应用。KD 被广泛用于提升小核 ConvNets 的性能。然而,先前研究表明,从 Transformer 向小核 ConvNets 蒸馏知识(如全局信息)效果不佳,推测源于二者架构差异较大。为此,我们开展了首项此类研究,揭示出现代大核 ConvNets——作为视觉 Transformer 的有力竞争者——由于架构更为相似,对小核 ConvNets 而言是显著更有效的教师模型。我们的发现得到了在 logit 级和特征级 KD 上大量“开箱即用”实验的支持,无需专门的架构或训练策略修改。值得注意的是,我们在 ImageNet 上以低于 3000 万参数取得了\textbf{史上最佳纯 ConvNet} 性能,top-1 准确率达 \textbf{83.1\%},优于包括 ConvNeXt V2 和 Swin V2 在内的当前 SOTA 方法。我们还发现,大核 ConvNets 的有益特性(如更大的有效感受野)可通过这种大核到小核的蒸馏无缝迁移给学生网络。代码见:\url{https://github.com/VITA-Group/SLaK}。

关键词

引用

@article{arxiv.2305.19412,
  title  = {Are Large Kernels Better Teachers than Transformers for ConvNets?},
  author = {Tianjin Huang and Lu Yin and Zhenyu Zhang and Li Shen and Meng Fang and Mykola Pechenizkiy and Zhangyang Wang and Shiwei Liu},
  journal= {arXiv preprint arXiv:2305.19412},
  year   = {2023}
}

备注

Accepted by ICML 2023