中文

面向深度人脸识别的分组知识蒸馏

计算机视觉与模式识别 2023-04-11 v1

摘要

与基于特征的蒸馏方法相比,logits蒸馏可以放宽教师网络与学生网络之间特征维度一致的要求,但其在人脸识别中的性能被认为较差。一个主要挑战是轻量级学生网络由于模型容量低而难以拟合目标logits,这归因于人脸识别中身份数量庞大。因此,我们试图探查目标logits以提取与人脸身份相关的主要知识,并丢弃其余部分,使学生网络更容易实现蒸馏。具体而言,在预测中存在一个具有接近零值的尾部组,其包含用于蒸馏的少量知识。为清晰展示其影响,我们首先根据软化预测的累积概率将logits划分为两组,即主要组(Primary Group)与次要组(Secondary Group)。然后,我们将分组logits的知识蒸馏(KD)损失重组为三部分,即Primary-KD、Secondary-KD和Binary-KD。Primary-KD指从教师蒸馏主要知识,Secondary-KD旨在精炼少量知识但增加了蒸馏难度,Binary-KD确保教师与学生之间知识分布的一致性。我们通过实验发现:(1) Primary-KD和Binary-KD对KD不可或缺,(2) Secondary-KD是限制KD于瓶颈的罪魁祸首。因此,我们提出分组知识蒸馏(GKD),在最终KD损失计算中保留Primary-KD和Binary-KD但忽略Secondary-KD。在主流人脸识别基准上的大量实验结果证明了所提GKD优于最先进的方法。

关键词

引用

@article{arxiv.2304.04462,
  title  = {Grouped Knowledge Distillation for Deep Face Recognition},
  author = {Weisong Zhao and Xiangyu Zhu and Kaiwen Guo and Xiao-Yu Zhang and Zhen Lei},
  journal= {arXiv preprint arXiv:2304.04462},
  year   = {2023}
}

备注

9 pages, 2 figures, 7 tables, accepted by AAAI 2023