中文

从自回归到非自回归语音识别的知识迁移与蒸馏

声音 2022-07-22 v1 音频与语音处理

摘要

现代非自回归(NAR)语音识别系统旨在加速推理速度;然而,与自回归(AR)模型相比,它们存在性能下降以及模型规模庞大的问题。我们提出了一种新颖的知识迁移与蒸馏架构,利用 AR 模型的知识来提升 NAR 性能,同时减小模型规模。帧级和序列级目标被精心设计用于迁移学习。为了进一步提升 NAR 性能,我们开发了一种基于 Mask-CTC 的束搜索方法,以在推理阶段扩大搜索空间。实验表明,所提出的 NAR 束搜索在 AISHELL-1 基准上以可容忍的实时因子(RTF)增加将 CER 相对降低了超过 5%。通过知识迁移,与 AR 教师模型尺寸相同的 NAR 学生模型在 AISHELL-1 开发/测试集上分别获得 8%/16% 的相对 CER 降低,并在 LibriSpeech test-clean/other 集上获得超过 25% 的相对 WER 降低。此外,通过所提出的知识迁移与蒸馏,约小 9 倍的 NAR 模型在 AISHELL-1 和 LibriSpeech 基准上均实现了约 25% 的相对 CER/WER 降低。

关键词

引用

@article{arxiv.2207.10600,
  title  = {Knowledge Transfer and Distillation from Autoregressive to Non-Autoregressive Speech Recognition},
  author = {Xun Gong and Zhikai Zhou and Yanmin Qian},
  journal= {arXiv preprint arXiv:2207.10600},
  year   = {2022}
}

备注

Accepted to Interspeech 2022