从自回归到非自回归语音识别的知识迁移与蒸馏
声音
2022-07-22 v1 音频与语音处理
摘要
现代非自回归(NAR)语音识别系统旨在加速推理速度;然而,与自回归(AR)模型相比,它们存在性能下降以及模型规模庞大的问题。我们提出了一种新颖的知识迁移与蒸馏架构,利用 AR 模型的知识来提升 NAR 性能,同时减小模型规模。帧级和序列级目标被精心设计用于迁移学习。为了进一步提升 NAR 性能,我们开发了一种基于 Mask-CTC 的束搜索方法,以在推理阶段扩大搜索空间。实验表明,所提出的 NAR 束搜索在 AISHELL-1 基准上以可容忍的实时因子(RTF)增加将 CER 相对降低了超过 5%。通过知识迁移,与 AR 教师模型尺寸相同的 NAR 学生模型在 AISHELL-1 开发/测试集上分别获得 8%/16% 的相对 CER 降低,并在 LibriSpeech test-clean/other 集上获得超过 25% 的相对 WER 降低。此外,通过所提出的知识迁移与蒸馏,约小 9 倍的 NAR 模型在 AISHELL-1 和 LibriSpeech 基准上均实现了约 25% 的相对 CER/WER 降低。
引用
@article{arxiv.2207.10600,
title = {Knowledge Transfer and Distillation from Autoregressive to Non-Autoregressive Speech Recognition},
author = {Xun Gong and Zhikai Zhou and Yanmin Qian},
journal= {arXiv preprint arXiv:2207.10600},
year = {2022}
}
备注
Accepted to Interspeech 2022