中文

面向低资源语音识别的高效融合预训练声学与语言编码器

计算与语言 2021-05-12 v2 声音 音频与语音处理

摘要

端到端模型在自动语音识别(ASR)任务上已取得令人印象深刻的成果。然而对于低资源 ASR 任务,标注数据难以满足端到端模型的需求。自监督声学预训练已展现出惊人的 ASR 性能,但其中的转写文本仍不足以用于端到端模型的语言建模。在本工作中,我们将预训练声学编码器(wav2vec2.0)与预训练语言编码器(BERT)融合为一个端到端 ASR 模型。该融合模型仅需在有限标注数据上微调时学习从语音到语言的迁移。两种模态的长度通过无额外参数的单调注意力机制进行匹配。此外,引入全连接层用于模态间的隐层映射。我们进一步提出一种 scheduled 微调策略,以保留并利用预训练语言编码器的文本上下文建模能力。实验显示了我们对预训练模块的有效利用。我们的模型在 CALLHOME 语料库(15 小时)上取得了优于其他端到端模型的识别性能。

关键词

引用

@article{arxiv.2101.06699,
  title  = {Efficiently Fusing Pretrained Acoustic and Linguistic Encoders for Low-resource Speech Recognition},
  author = {Cheng Yi and Shiyu Zhou and Bo Xu},
  journal= {arXiv preprint arXiv:2101.06699},
  year   = {2021}
}