FitNets:为窄深度网络提供提示
机器学习
2015-03-30 v4 神经与进化计算
摘要
虽然深度往往能提升网络性能,但它也使基于梯度的训练更加困难,因为更深的网络往往更具非线性。最近提出的知识蒸馏方法旨在获得小型且执行快速的模型,并已证明学生网络可以模仿较大的教师网络或网络集成的软输出。在本文中,我们扩展了这一思想,允许训练一个比教师网络更深、更窄的学生网络,不仅利用教师的输出,还利用教师学习到的中间表示作为提示,以改善训练过程和学生的最终性能。由于学生的中间隐藏层通常比教师的中间隐藏层小,因此引入了额外的参数将学生的隐藏层映射到教师隐藏层的预测。这使得我们可以训练出泛化能力更强或运行速度更快的更深层学生网络,这种权衡由所选的学生容量控制。例如,在CIFAR-10上,一个参数数量几乎少10.4倍的深度学生网络,其性能优于一个更大、当时最先进的教师网络。
引用
@article{arxiv.1412.6550,
title = {FitNets: Hints for Thin Deep Nets},
author = {Adriana Romero and Nicolas Ballas and Samira Ebrahimi Kahou and Antoine Chassang and Carlo Gatta and Yoshua Bengio},
journal= {arXiv preprint arXiv:1412.6550},
year = {2015}
}