全在头部:通过分类器共享的表示知识蒸馏
计算机视觉与模式识别
2022-04-06 v2
摘要
表示知识蒸馏旨在将丰富的信息从一个模型迁移到另一个模型。表示蒸馏的常用方法主要聚焦于直接最小化模型嵌入向量之间的距离度量。此类直接方法在迁移表示向量中嵌入的高阶依赖关系,或处理教师模型与学生模型之间的容量差距方面可能存在局限。此外,在标准知识蒸馏中,教师模型是在未感知学生特性和容量的情形下训练的。本文中,我们探索了两种利用教师与学生之间分类器共享来增强表示蒸馏的机制。我们首先研究了一种简单方案,即将教师的分类器连接到学生骨干网络,充当额外的分类头。随后,我们提出了一种学生感知机制,通过用临时学生头训练教师模型,使其适应容量有限的学生。我们分析并比较了这两种机制,并在包括图像分类、细粒度分类和人脸验证在内的多个数据集与任务上展示了其有效性。特别地,我们在 IJB-C 数据集上以 MobileFaceNet 模型实现了人脸验证的 SOTA 结果:TAR@(FAR=1e-5)=93.7%。代码见 https://github.com/Alibaba-MIIL/HeadSharingKD。
引用
@article{arxiv.2201.06945,
title = {It's All in the Head: Representation Knowledge Distillation through Classifier Sharing},
author = {Emanuel Ben-Baruch and Matan Karklinsky and Yossi Biton and Avi Ben-Cohen and Hussam Lawen and Nadav Zamir},
journal= {arXiv preprint arXiv:2201.06945},
year = {2022}
}