中文

利用预训练声学模型和语言模型改进非自回归端到端语音识别

音频与语音处理 2022-01-27 v2 声音

摘要

尽管 Transformer 在端到端 (E2E) 自动语音识别 (ASR) 中取得了可喜的成果,但其自回归 (AR) 结构成为加速解码过程的瓶颈。对于实际部署,ASR 系统既需要高精度,又需要快速推理。非自回归 (NAR) 模型因其快速的推理速度而成为流行的替代方案,但在识别准确率上仍落后于 AR 系统。为了满足这两个需求,在本文中,我们提出了一种利用预训练声学模型和语言模型(wav2vec2.0 和 BERT)的 NAR CTC/attention 模型。为了弥合从预训练模型获得的语音和文本表示之间的模态差距,我们设计了一种新颖的模态转换机制,该机制更适合表意文字语言。在推理过程中,我们采用 CTC 分支生成目标长度,这使得 BERT 能够并行预测 token。我们还设计了一种基于缓存的 CTC/attention 联合解码方法,以在保持解码速度的同时提高识别准确率。实验结果表明,所提出的 NAR 模型大大优于我们强大的 wav2vec2.0 CTC 基线(在 AISHELL-1 上相对 CER 降低 15.1%)。所提出的 NAR 模型在 AISHELL-1 基准测试上显著超越了以往的 NAR 系统,并在英语任务中展现出潜力。

关键词

引用

@article{arxiv.2201.10103,
  title  = {Improving non-autoregressive end-to-end speech recognition with pre-trained acoustic and language models},
  author = {Keqi Deng and Zehui Yang and Shinji Watanabe and Yosuke Higuchi and Gaofeng Cheng and Pengyuan Zhang},
  journal= {arXiv preprint arXiv:2201.10103},
  year   = {2022}
}

备注

Accepted by ICASSP2022