通过蒸馏与量化的模型压缩
神经与进化计算
2018-02-16 v1 机器学习
摘要
深度神经网络(DNNs)持续取得显著进展,解决了从图像分类到翻译或强化学习的任务。该领域受到相当关注的一个方面是在资源受限环境(如移动或嵌入式设备)中高效执行深度模型。本文聚焦于该问题,并提出两种新的压缩方法,它们联合利用权重量化以及将较大教师网络蒸馏为较小学生网络。我们提出的第一个方法称为量化蒸馏,在训练过程中利用蒸馏,通过将相对于教师的蒸馏损失纳入权重被量化为有限级数的学生网络训练中。第二种方法,可微量化,通过随机梯度下降优化量化点的位置,以更好地拟合教师模型的行为。我们通过卷积和循环架构上的实验验证了两种方法。我们表明量化浅层学生网络可达到与全精度教师模型相似的准确率水平,同时提供数量级的压缩和随深度缩减呈线性的推理加速。总之,我们的结果使资源受限环境中的 DNNs 能够利用在更强设备上开发的架构与准确率进展。
引用
@article{arxiv.1802.05668,
title = {Model compression via distillation and quantization},
author = {Antonio Polino and Razvan Pascanu and Dan Alistarh},
journal= {arXiv preprint arXiv:1802.05668},
year = {2018}
}
备注
21 pages, published as a conference paper at ICLR2018