通过特征模仿进行知识蒸馏
计算机视觉与模式识别
2021-08-17 v2 机器学习
摘要
知识蒸馏(KD)是一种借助高容量网络(“教师”)训练高效网络(“学生”)的流行方法。传统方法利用教师的软 logits 作为额外监督来训练学生网络。本文认为,让学生模仿教师倒数第二层的特征更具优势。学生不仅可以直接从教师特征中学习更有效的信息,特征模仿也可应用于无 softmax 层训练的教师。实验表明,该方法可比传统 KD 达到更高精度。为进一步促进特征模仿,我们将特征向量分解为幅值与方向。我们认为教师应给学生特征幅值更多自由,让学生更关注模仿特征方向。为满足此要求,我们提出一种基于局部敏感哈希(LSH)的损失项。在该新损失帮助下,我们的方法确实更准确地模仿了特征方向,放宽了对特征幅值的约束,并达到了最先进的蒸馏精度。我们给出了 LSH 如何促进特征方向模仿的理论分析,并将特征模仿进一步扩展到多标签识别与目标检测。
引用
@article{arxiv.2011.01424,
title = {Distilling Knowledge by Mimicking Features},
author = {Guo-Hua Wang and Yifan Ge and Jianxin Wu},
journal= {arXiv preprint arXiv:2011.01424},
year = {2021}
}
备注
To appear in IEEE Trans. PAMI