中文

异构蒸馏中的知识融合迁移

计算机视觉与模式识别 2025-07-30 v2 人工智能

摘要

大多数知识蒸馏(KD)方法主要关注具有相似结构的教师-学生配对,如两者都是卷积神经网络(CNN)。然而,扩大 KD 可大幅提高其潜力和灵活性,通过扩展到新的跨架构蒸馏(CAKD),其中来自同构和异构教师的知识可以灵活地传输给给定的学生。在 CAKD 中,主要挑战在于来自异构模型之间巨大的特征差距,这种差距源于其固有归纳偏置和模块功能的区别。为此,我们引入一个辅助模型作为桥梁,以促进异构教师和学生之间平滑的特征知识传输。更重要的是,在我们提出的设计原则中,辅助模型通过合并来自学生和教师模块功能的卷积和注意力模块,融合了跨架构的归纳偏置和模块功能优势。此外,我们观察到在 CAKD 中,异构特征在空间上呈现出多样化分布,阻碍了常规像素级均方误差(MSE)损失的有效性。因此,我们利用空间无关的 InfoNCE 损失对空间平滑后的特征进行对齐,从而提高 CAKD 中的特征对齐效果。我们的方法在一些同构模型对和任意异构 CNN、ViT 和 MLP 的组合上进行评估,在 CIFAR-100 上实现最高提升 11.47%,在 ImageNet-1K 上实现 3.67% 的最佳性能。我们将发布代码和模型。

关键词

引用

@article{arxiv.2410.12342,
  title  = {Fuse Before Transfer: Knowledge Fusion for Heterogeneous Distillation},
  author = {Guopeng Li and Qiang Wang and Ke Yan and Shouhong Ding and Yuan Gao and Gui-Song Xia},
  journal= {arXiv preprint arXiv:2410.12342},
  year   = {2025}
}

备注

Accepted by ICCV2025