中文

FreeKD:基于语义频率提示的知识蒸馏

计算机视觉与模式识别 2024-05-24 v2

摘要

知识蒸馏(KD)已成功应用于多种任务,主流方法通常通过空间模仿损失来提升学生模型。然而,教师模型空间域中连续的降采样是一种破坏,阻碍学生分析需要模仿的具体信息,从而导致精度下降。为了更好地理解被破坏特征图的潜在模式,我们将注意力转向频域。在频率蒸馏过程中,我们遇到一个新挑战:低频带传达通用但极少的上下文,而高频带信息更丰富但也引入噪声。频带内并非每个像素对性能的贡献都相等。针对上述问题:(1)我们提出插入教师模型的频率提示(Frequency Prompt),在微调过程中吸收语义频率上下文。(2)在蒸馏阶段,通过频率提示生成逐像素频率掩码,以定位各频带中感兴趣像素(PoIs)。此外,我们针对密集预测任务采用位置感知关系频率损失,为学生模型提供高阶空间增强。我们将提出的频率知识蒸馏方法命名为 FreeKD,其确定了频率蒸馏的最优定位与范围。大量实验表明,FreeKD 不仅在密集预测任务上持续优于基于空间的蒸馏方法(例如,在 COCO2017 上为 RepPoints-R50 带来 3.8 AP 增益,在 Cityscapes 上为 PSPNet-R18 带来 4.55 mIoU 增益),而且为学生模型提供了更强的鲁棒性。值得注意的是,我们还在大规模视觉模型(例如 DINO 和 SAM)上验证了方法的泛化性。

关键词

引用

@article{arxiv.2311.12079,
  title  = {FreeKD: Knowledge Distillation via Semantic Frequency Prompt},
  author = {Yuan Zhang and Tao Huang and Jiaming Liu and Tao Jiang and Kuan Cheng and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2311.12079},
  year   = {2024}
}

备注

Accepted by CVPR 2024