基于注意力机制的代表性教师键值知识蒸馏模型压缩方法用于图像分类
计算机视觉与模式识别
2022-10-21 v4 人工智能
摘要
随着 AI 芯片(如 GPU、TPU 和 NPU)的改进以及物联网(IoT)的快速发展,一些鲁棒的深度神经网络(DNN)通常由数百万甚至数亿个参数组成。如此大的模型可能不适合直接部署在低算力和低容量单元(如边缘设备)上。知识蒸馏(KD)近来被公认为一种有效的模型压缩方法,可大幅减少模型参数。KD 的核心概念是从大模型(即教师模型)的特征图中提取有用信息作为参考,以成功训练一个小模型(即学生模型),其模型尺寸远小于教师模型。尽管已提出许多 KD 方法利用教师模型中间层特征图的信息,但大多数未考虑教师模型与学生模型之间特征图的相似性。因此,这可能使学生模型学到无用信息。受注意力机制启发,我们提出一种称为代表性教师键(RTK)的新型 KD 方法,其不仅考虑特征图的相似性,还过滤掉无用信息以提升目标学生模型的性能。在实验中,我们使用多个骨干网络(如 ResNet 和 WideResNet)和数据集(如 CIFAR10、CIFAR100、SVHN 和 CINIC10)验证所提方法。结果表明,我们提出的 RTK 能有效提升最先进的基于注意力的 KD 方法的分类精度。
引用
@article{arxiv.2206.12788,
title = {Representative Teacher Keys for Knowledge Distillation Model Compression Based on Attention Mechanism for Image Classification},
author = {Jun-Teng Yang and Sheng-Che Kao and Scott C. -H. Huang},
journal= {arXiv preprint arXiv:2206.12788},
year = {2022}
}
备注
eight pages, six figures, three tables