跨架构知识蒸馏
计算机视觉与模式识别
2022-11-16 v2
摘要
Transformer 因其学习全局关系的能力和优越的性能而备受关注。为了获得更高的性能,将 Transformer 中的互补知识蒸馏到卷积神经网络(CNN)中是自然而然的做法。然而,大多数现有的知识蒸馏方法仅考虑同构架构蒸馏,例如从 CNN 到 CNN 的知识蒸馏。当应用于跨架构场景(如从 Transformer 到 CNN)时,它们可能并不适用。为解决该问题,本文提出了一种新颖的跨架构知识蒸馏方法。具体而言,不同于直接模仿教师模型的输出或中间特征,该方法引入了部分交叉注意力投影器和分组线性投影器,以在两个投影特征空间中将学生特征与教师特征对齐。并进一步提出了一种多视角鲁棒训练方案,以提高框架的鲁棒性和稳定性。大量实验表明,所提方法在小型和大型数据集上均优于 14 种当前最优(SOTA)方法。
引用
@article{arxiv.2207.05273,
title = {Cross-Architecture Knowledge Distillation},
author = {Yufan Liu and Jiajiong Cao and Bing Li and Weiming Hu and Jingting Ding and Liang Li},
journal= {arXiv preprint arXiv:2207.05273},
year = {2022}
}
备注
Accepted by ACCV 2022