中文

通过从预训练语言模型迁移知识改进基于CTC的语音识别

计算与语言 2022-03-08 v1 声音 音频与语音处理

摘要

近年来,基于连接主义时序分类(CTC)的端到端自动语音识别模型取得了令人印象深刻的成果,特别是在从wav2vec2.0模型微调时。由于条件独立假设,基于CTC的模型始终弱于基于注意力的编码器-解码器模型,并需要外部语言模型(LMs)的辅助。为解决此问题,我们提出两种利用预训练LMs(如BERT和GPT2)来改进基于CTC模型的知识迁移方法。第一种方法基于表征学习,其中基于CTC的模型使用BERT产生的表征作为辅助学习目标。第二种方法基于联合分类学习,将GPT2用于文本建模并与混合CTC/注意力架构相结合。在AISHELL-1语料库上的实验在测试集上取得了4.2%的字错率(CER)。与从wav2vec2.0模型微调的朴素基于CTC的模型相比,我们的知识迁移方法在无外部LMs的情况下相对降低了16.1%的CER。

关键词

引用

@article{arxiv.2203.03582,
  title  = {Improving CTC-based speech recognition via knowledge transferring from pre-trained language models},
  author = {Keqi Deng and Songjun Cao and Yike Zhang and Long Ma and Gaofeng Cheng and Ji Xu and Pengyuan Zhang},
  journal= {arXiv preprint arXiv:2203.03582},
  year   = {2022}
}

备注

ICASSP 2022