做自己的老师:通过自蒸馏提升卷积神经网络性能
机器学习
2019-05-21 v1 机器学习
摘要
卷积神经网络已广泛部署于各种应用场景中。为了将应用边界扩展至某些对精度要求严苛的领域,研究者一直在探索通过更深或更宽的网络结构来提升准确率的方法,但这带来了计算与存储成本的指数级增长,并延迟了响应时间。本文提出一种称为自蒸馏的通用训练框架,它通过缩小网络规模而非扩大网络来显著提升卷积神经网络的性能(准确率)。不同于传统知识蒸馏——一种网络间的知识迁移方法,其强制学生神经网络逼近预训练教师神经网络的 softmax 层输出——所提自蒸馏框架在网络自身内部蒸馏知识。网络首先被划分为若干段,然后将网络较深部分的知识压缩至较浅部分。实验进一步证明了所提自蒸馏框架的泛化性:平均准确率提升为 2.65%,最低为 ResNeXt 中的 0.61%,最高为 VGG19 中的 4.07%。此外,它还能在资源受限的边缘设备上提供深度可伸缩推理的灵活性。我们的代码将很快发布于 github。
引用
@article{arxiv.1905.08094,
title = {Be Your Own Teacher: Improve the Performance of Convolutional Neural Networks via Self Distillation},
author = {Linfeng Zhang and Jiebo Song and Anni Gao and Jingwei Chen and Chenglong Bao and Kaisheng Ma},
journal= {arXiv preprint arXiv:1905.08094},
year = {2019}
}
备注
10pages