中文

ScaleKD:强预训练视觉Transformer可以是优秀的教师

计算机视觉与模式识别 2024-11-12 v1 人工智能 机器学习

摘要

本文探讨了良好预训练的视觉Transformer (ViT) 模型是否可以作为教师,展现可扩展特性以推动跨架构知识蒸馏 (KD) 研究,特别是在使用大规模数据集进行评估的背景下。为此,我们的分析强调了寻找有效策略来对齐以下三个差异的重要性:(1) 特征计算范式差异,(2) 模型规模差异,(3) 知识密度差异。通过结合三个耦合组件——交叉注意力投影器、双视角特征模仿和教师参数感知——我们提出了一种简单而有效的KD方法,称为ScaleKD。我们的方法可以在图像分类数据集上训练跨越卷积神经网络 (CNN)、多层感知器 (MLP) 和ViT架构的学生骨干网络,实现了最先进的蒸馏性能。例如,以一个良好预训练的Swin-L作为教师模型,我们的方法为从ImageNet-1K数据集从头训练的学生模型取得了MobileNet-V1|ResNet-50|ConvNeXt-T|Mixer-S/16|Mixer-B/16|ViT-S/16|Swin-T|ViT-B/16模型分别75.15%|82.03%|84.16%|78.63%|81.96%|83.93%|83.80%|85.53%的top-1准确率,相比独立训练的对照组分别提升了3.05%|3.39%|2.02%|4.61%|5.52%|4.03%|2.62%|3.73%的绝对增益。有趣的是,当扩大教师模型或其预训练数据集的规模时,我们的方法展现了期望的可扩展特性,为学生模型带来了越来越大的收益。由我们方法训练的学生骨干网络在MS-COCO和ADE20K下游数据集上表现良好。更重要的是,如果存在一个强预训练的ViT,我们的方法可以作为耗时的预训练范式的一种更高效的替代方案,将学生模型所需的查看训练样本数量减少多达195倍。

关键词

引用

@article{arxiv.2411.06786,
  title  = {ScaleKD: Strong Vision Transformers Could Be Excellent Teachers},
  author = {Jiawei Fan and Chao Li and Xiaolong Liu and Anbang Yao},
  journal= {arXiv preprint arXiv:2411.06786},
  year   = {2024}
}

备注

This work is accepted to NeurIPS 2024. The project page: https://github.com/deep-optimization/ScaleKD