Wav-BERT:面向低资源语音识别的声学与语言协同表示学习
计算与语言
2021-10-12 v2 音频与语音处理
摘要
统一声学与语言表示学习对于将丰富高资源语言数据上习得的知识迁移至低资源语音识别已变得愈发关键。现有方法简单地级联预训练声学模型与语言模型来学习从语音到文本的迁移。然而,如何解决语音与文本间的表示差异尚未被探索,这阻碍了声学与语言信息的利用。此外,先前工作简单地用声学特征替换预训练语言模型的嵌入层,可能导致灾难性遗忘问题。本工作中,我们提出Wav-BERT,一种协同声学与语言表示学习方法,以融合并利用语音与文本的上下文信息。具体而言,我们将预训练声学模型(wav2vec 2.0)与语言模型(BERT)统一为端到端可训练框架。设计表示聚合模块以聚合声学与语言表示,并引入嵌入注意力模块将声学信息融入BERT,可有效促进两个预训练模型的协作从而提升表示学习。大量实验表明,我们的Wav-BERT显著优于现有方法,并在低资源语音识别上取得最先进性能。
引用
@article{arxiv.2109.09161,
title = {Wav-BERT: Cooperative Acoustic and Linguistic Representation Learning for Low-Resource Speech Recognition},
author = {Guolin Zheng and Yubei Xiao and Ke Gong and Pan Zhou and Xiaodan Liang and Liang Lin},
journal= {arXiv preprint arXiv:2109.09161},
year = {2021}
}