蒸馏神经网络中的知识
机器学习
2015-03-10 v1 机器学习
神经与进化计算
摘要
改进几乎所有机器学习算法性能的一个非常简单的方法是在相同数据上训练许多不同模型,然后平均它们的预测。不幸的是,使用整个模型集成进行预测很繁琐,并且计算开销可能太大而无法部署给大量用户,尤其是当单个模型是大型神经网络时。Caruana及其合作者已经证明,可以将集成中的知识压缩到单个模型中,该模型更易于部署,而我们采用不同的压缩技术进一步发展了该方法。我们在MNIST上取得了一些令人惊讶的结果,并且表明我们可以通过将集成模型中的知识蒸馏到单个模型中来显著改进一个被广泛使用的商业系统的声学模型。我们还引入了一种新型集成,由一个或多个完整模型和许多专家模型组成,这些专家模型学习区分完整模型混淆的细粒度类别。与混合专家不同,这些专家模型可以快速并行训练。
引用
@article{arxiv.1503.02531,
title = {Distilling the Knowledge in a Neural Network},
author = {Geoffrey Hinton and Oriol Vinyals and Jeff Dean},
journal= {arXiv preprint arXiv:1503.02531},
year = {2015}
}
备注
NIPS 2014 Deep Learning Workshop