两遍端到端自动语音识别模型压缩
音频与语音处理
2022-01-11 v1 声音
摘要
智能设备上的语音识别由于内存占用小而具有挑战性。因此,小尺寸的 ASR 模型是理想的。随着流行的基于 transducer 的模型的使用,在实际中于小型设备上部署流式语音识别模型已成为可能[1]。近来,结合 RNN-T 与 LAS 模块的两遍模型[2]在流式设备端语音识别中展现出卓越性能。在本工作中,我们提出一种简单而有效的方法,用于减小两遍模型的尺寸以适配内存受限设备。我们采用流行的知识蒸馏方法,利用教师-学生训练技术分三个阶段进行。第一阶段,我们使用训练好的 RNN-T 模型作为教师模型,并执行知识蒸馏来训练学生 RNN-T 模型。第二阶段使用共享编码器,并利用训练好的 RNN-T+LAS 教师模型为学生模型训练一个 LAS 重打分器。最后,我们对具有共享 RNN-T 编码器、RNN-T 解码器和 LAS 重打分器的学生模型进行深度微调。我们在标准 LibriSpeech 数据集上的实验结果表明,与两遍教师模型相比,我们的系统可实现 55% 的高压缩率,且 WER 无显著退化。
引用
@article{arxiv.2201.02741,
title = {Two-Pass End-to-End ASR Model Compression},
author = {Nauman Dawalatabad and Tushar Vatsal and Ashutosh Gupta and Sungsoo Kim and Shatrughan Singh and Dhananjaya Gowda and Chanwoo Kim},
journal= {arXiv preprint arXiv:2201.02741},
year = {2022}
}
备注
IEEE ASRU 2021