面向 RNN-Transducer 模型的高效知识蒸馏
音频与语音处理
2020-11-13 v1 声音
摘要
知识蒸馏是一种将知识从大模型迁移到小模型的有效方法。蒸馏可视为一种模型压缩方式,并在设备端 ASR 应用中发挥了重要作用。在本文中,我们为 RNN-Transducer(RNN-T)模型开发了一种蒸馏方法,RNN-T 是用于流式语音识别的流行端到端神经网络架构。我们提出的蒸馏损失简单高效,仅使用来自 RNN-T 输出概率栅格的“y”与“blank”后验概率。我们研究了该方法在提升由逐步剪枝较大未压缩模型(其同时作为蒸馏中的教师模型)所获得的稀疏 RNN-T 模型精度方面的有效性。通过对 60% 和 90% 稀疏的多域 RNN-T 模型进行蒸馏,我们在含噪 FarField 评测集上分别获得了 4.3% 和 12.1% 的 WER 降低。我们还给出了在 LibriSpeech 上的实验结果,其中引入蒸馏损失使一个小型 Conformer 模型在 test-other 数据集上获得了 4.8% 的相对 WER 降低。
引用
@article{arxiv.2011.06110,
title = {Efficient Knowledge Distillation for RNN-Transducer Models},
author = {Sankaran Panchapagesan and Daniel S. Park and Chung-Cheng Chiu and Yuan Shangguan and Qiao Liang and Alexander Gruenstein},
journal= {arXiv preprint arXiv:2011.06110},
year = {2020}
}
备注
5 pages, 1 figure, 2 tables; submitted to ICASSP 2021