面向小足迹 Highway 网络的知识蒸馏
计算与语言
2016-12-22 v3
摘要
近年来,深度学习显著推进了语音识别的最先进水平。然而,与传统的的高斯混合声学模型相比,神经网络模型通常大得多,因此在嵌入式设备中不太可部署。此前,我们研究了一种用于声学建模的紧凑型 Highway 深度神经网络(HDNN),它是一种深度门控前馈神经网络。我们已经证明,基于 HDNN 的声学模型能以远少于普通深度神经网络(DNN)声学模型的参数数量实现可比的识别准确率。在本文中,我们利用亦称为“师生训练”的知识蒸馏技术进一步推进边界,即我们在高精度笨重模型的监督下训练紧凑 HDNN 模型。此外,我们还研究了师生训练背景下的序列训练与自适应。我们的实验在 AMI 会议语音识别语料库上进行。借助该技术,我们显著提升了参数量少于 80 万的 HDNN 声学模型的识别准确率,并缩小了该模型与拥有 3000 万参数的普通 DNN 之间的差距。
引用
@article{arxiv.1608.00892,
title = {Knowledge Distillation for Small-footprint Highway Networks},
author = {Liang Lu and Michelle Guo and Steve Renals},
journal= {arXiv preprint arXiv:1608.00892},
year = {2016}
}
备注
5 pages, 2 figures, accepted to icassp 2017