中文

NORM:通过 N 对一表示匹配的知识蒸馏

计算机视觉与模式识别 2023-05-24 v1 人工智能 机器学习

摘要

现有的特征蒸馏方法通常采用任意预选师生层对之间的一对一表示匹配。本文提出 NORM(N-to-One Representation),一种新颖的两阶段知识蒸馏方法,其依赖于由两层线性层组成的简单特征变换(FT)模块。为保留教师网络学到的完整信息,训练期间我们的 FT 模块仅插入在学生网络最后卷积层之后。第一线性层将学生表示投影到具有教师最后卷积层表示 N 倍特征通道的特征空间,第二线性层将扩展输出收缩回原始特征空间。通过顺序地将扩展的学生表示分割为 N 个与教师表示通道数相同的非重叠特征段,它们可同时被强制逼近完整的教师表示,从而形成一种基于单一师生层对的新型多对一表示匹配机制。训练后,得益于其线性特性,该 FT 模块将自然合并入后续全连接层,在推理时不给学生网络引入额外参数或架构修改。在不同视觉识别基准上的大量实验证明了我们方法的领先性能。例如,当使用预训练的 ResNet34|ResNet50|ResNet50 模型作教师时,经 NORM 训练的 ResNet18|MobileNet|ResNet50-1/4 模型在 ImageNet 数据集上分别达到 72.14%|74.26%|68.03% 的 top-1 准确率,相较各自独立训练的对应模型绝对提升 2.01%|4.63%|3.03%。代码见 https://github.com/OSVAI/NORM

关键词

引用

@article{arxiv.2305.13803,
  title  = {NORM: Knowledge Distillation via N-to-One Representation Matching},
  author = {Xiaolong Liu and Lujun Li and Chao Li and Anbang Yao},
  journal= {arXiv preprint arXiv:2305.13803},
  year   = {2023}
}

备注

The paper of NORM is published at ICLR 2023. Code and models are available at https://github.com/OSVAI/NORM