用于语音翻译与识别的统一语音-文本预训练
计算与语言
2022-04-13 v1
摘要
我们描述了一种在编码器-解码器建模框架中联合预训练语音和文本以用于语音翻译与识别的方法。所提方法结合了四个自监督与有监督子任务以实现跨模态学习。一个自监督语音子任务利用未标注语音数据,一个(自)监督文本到文本子任务利用丰富的文本训练数据。包含两个辅助有监督语音任务以统一语音与文本建模空间。我们的贡献在于将文本语料库中的语言信息整合到语音预训练中。详细分析揭示了子任务之间的学习干扰。分别给出了用于语音翻译与识别的两种预训练配置以缓解子任务干扰。我们的实验表明所提方法能有效地将语音与文本信息融合到一个模型中。在 MuST-C 语音翻译数据集上,它取得了比当前最优(state of the art)高 1.7 至 2.3 BLEU 的提升,并在 Librispeech 语音识别任务上取得与 wav2vec 2.0 相当的 WER。
引用
@article{arxiv.2204.05409,
title = {Unified Speech-Text Pre-training for Speech Translation and Recognition},
author = {Yun Tang and Hongyu Gong and Ning Dong and Changhan Wang and Wei-Ning Hsu and Jiatao Gu and Alexei Baevski and Xian Li and Abdelrahman Mohamed and Michael Auli and Juan Pino},
journal= {arXiv preprint arXiv:2204.05409},
year = {2022}
}
备注
ACL 2022 main conference