中文

利用预训练声学模型与语言模型改进混合CTC/注意力端到端语音识别

音频与语音处理 2021-12-15 v1 计算与语言 声音

摘要

近来,自监督预训练在端到端(E2E)自动语音识别(ASR)中取得了令人印象深刻的成果。然而,主导的序列到序列(S2S)E2E模型仍难以充分利用自监督预训练方法,因为其解码器以声学表示为条件,因此无法单独预训练。本文中,我们提出一种基于混合CTC/注意力E2E模型的预训练Transformer(Preformer)S2S ASR架构,以充分利用预训练的声学模型(AM)与语言模型(LM)。在我们的框架中,编码器用预训练AM(wav2vec2.0)初始化。Preformer在训练与推理时利用CTC作为辅助任务。此外,我们设计了一个单次交叉解码器(OCD),它放宽了对声学表示的依赖,从而可用预训练LM(DistilGPT2)初始化。实验在AISHELL-1语料上进行,并在测试集上取得4.6%4.6\%字符错误率(CER)。与我们原始的混合CTC/注意力Transformer基线相比,所提出的基于CTC/注意力的Preformer带来了27%27\%的相对CER降低。据我们所知,这是首个在S2S ASR系统中同时利用预训练AM和LM的工作。

关键词

引用

@article{arxiv.2112.07254,
  title  = {Improving Hybrid CTC/Attention End-to-end Speech Recognition with Pretrained Acoustic and Language Model},
  author = {Keqi Deng and Songjun Cao and Yike Zhang and Long Ma},
  journal= {arXiv preprint arXiv:2112.07254},
  year   = {2021}
}

备注

ASRU2021