中文

基于目标感知 Transformer 的知识蒸馏

计算机视觉与模式识别 2024-04-09 v2

摘要

知识蒸馏已成为提升小型神经网络性能的事实标准。以往工作多主张以一对一空间匹配方式将教师网络的特征表示回归给学生网络。然而,人们往往忽视:由于架构差异,同一空间位置上的语义信息通常并不一致,这严重削弱了其一对一蒸馏方法的潜在假设。为此,我们提出一种新颖的一对全空间匹配知识蒸馏方法。具体而言,我们根据由目标感知 transformer 生成的相似度,允许教师特征的每个像素蒸馏到学生特征的所有空间位置。我们的方法在 ImageNet、Pascal VOC 和 COCOStuff10k 等多个计算机视觉基准上大幅超越最先进方法。代码见 https://github.com/sihaoevery/TaT。

关键词

引用

@article{arxiv.2205.10793,
  title  = {Knowledge Distillation via the Target-aware Transformer},
  author = {Sihao Lin and Hongwei Xie and Bing Wang and Kaicheng Yu and Xiaojun Chang and Xiaodan Liang and Gang Wang},
  journal= {arXiv preprint arXiv:2205.10793},
  year   = {2024}
}

备注

CVPR2022(Oral)