深度模型压缩:从噪声教师中蒸馏知识
机器学习
2016-11-03 v2
摘要
深度学习模型在各种应用中的显著成功导致了更深网络的设计,以求解复杂问题。然而,此类模型不断增加的深度也带来了更高的存储和运行时复杂度,这限制了此类极深模型在存储和电池容量有限的移动与便携设备上的可部署性。尽管近年来提出了许多深度模型压缩方法,但几乎都聚焦于降低存储复杂度。本工作中,我们扩展了用于深度模型压缩的教师-学生框架,因为它也有潜力解决运行时和训练时复杂度。我们提出一种简单方法,在从教师训练学生时引入基于噪声的正则化器,这为学生网络性能带来了良性提升。我们在 CIFAR-10、SVHN 和 MNIST 数据集上的实验显示出有前景的改进,并在 CIFAR-10 数据集上取得最佳性能。我们还对提出的方法在 CIFAR-10 数据集的相关设置下进行了全面的实证评估,以展示所提方法的潜力。
引用
@article{arxiv.1610.09650,
title = {Deep Model Compression: Distilling Knowledge from Noisy Teachers},
author = {Bharat Bhusan Sau and Vineeth N. Balasubramanian},
journal= {arXiv preprint arXiv:1610.09650},
year = {2016}
}
备注
9 pages, 3 figures