面向人脸识别的跨架构知识蒸馏
计算机视觉与模式识别
2023-06-27 v1 机器学习
摘要
Transformer已成为人脸识别任务的首选,但其平台加速不足阻碍了在移动设备上的应用。相比之下,卷积神经网络(CNN)可利用硬件兼容的加速库。因此,在将知识从基于Transformer的教师模型迁移至基于CNN的学生模型时,保持蒸馏效能不可或缺,此即跨架构知识蒸馏(CAKD)。尽管潜力巨大,CAKD在人脸识别中的部署面临两重挑战:1)教师与学生对每个像素拥有异构空间信息,阻碍特征空间对齐;2)教师网络未以教师角色训练,缺乏处理蒸馏专用知识的能力。为克服这两限制,1)我们首先引入统一感受野映射模块(URFM),将教师与学生的像素特征映射为具统一感受野的局部特征,从而同步师生像素级空间信息。随后,2)我们开发自适应提示教师网络(APT),将提示嵌入教师以使其能处理蒸馏专用知识,同时保持模型判别力。在主流人脸基准与两个大规模验证集上的大量实验证明了本方法的优越性。
引用
@article{arxiv.2306.14662,
title = {Cross Architecture Distillation for Face Recognition},
author = {Weisong Zhao and Xiangyu Zhu and Zhixiang He and Xiao-Yu Zhang and Zhen Lei},
journal= {arXiv preprint arXiv:2306.14662},
year = {2023}
}