中文

DearKD:面向视觉Transformer的数据高效早期知识蒸馏

计算机视觉与模式识别 2022-04-29 v2

摘要

Transformer凭借其自注意力机制强大的建模能力,已成功应用于计算机视觉。然而,Transformer的优异性能严重依赖于海量训练图像。因此,迫切需要一种数据高效的Transformer解决方案。在本工作中,我们提出了一种称为DearKD的早期知识蒸馏框架,以提高Transformer所需的数据效率。我们的DearKD是一个两阶段框架:首先从卷积神经网络(CNN)的早期中间层蒸馏归纳偏置,然后在不进行蒸馏的情况下让Transformer充分发挥其能力。此外,我们的DearKD可以轻松应用于没有真实图像可用的极端无数据场景。在此场景下,我们提出了一种基于DeepInversion的边界保持内散度损失,以进一步缩小与全数据对应方案之间的性能差距。在ImageNet、部分ImageNet、无数据设置及其他下游任务上的大量实验证明了DearKD相对于其基线方法和最先进方法的优越性。

关键词

引用

@article{arxiv.2204.12997,
  title  = {DearKD: Data-Efficient Early Knowledge Distillation for Vision Transformers},
  author = {Xianing Chen and Qiong Cao and Yujie Zhong and Jing Zhang and Shenghua Gao and Dacheng Tao},
  journal= {arXiv preprint arXiv:2204.12997},
  year   = {2022}
}

备注

CVPR 2022