用于多模态双语预训练与语音翻译的声学与文本融合编码
计算与语言
2021-09-15 v2
摘要
近年来,文本与语音的表示学习已成功改进许多语言相关任务。然而,所有现有方法均存在两个局限:(a) 它们仅从单一输入模态学习,而端到端语音翻译等任务需要语音与文本的统一表示,因此 (b) 它们无法利用各种大规模文本与语音数据,其性能受限于平行语音翻译数据的稀缺。为解决这些问题,我们提出融合声学与文本掩码语言模型(FAT-MLM),该模型从多种语料(包括用于语音识别和机器翻译的平行数据,甚至纯语音与纯文本数据)中联合学习声学与文本输入的统一表示。在此跨模态表示学习框架内,我们进一步提出一个用于融合声学与文本语音翻译(FAT-ST)的端到端模型。三个翻译方向的实验表明,通过从 FAT-MLM 微调,我们提出的语音翻译模型将翻译质量显著提升至多 +5.9 BLEU。
引用
@article{arxiv.2102.05766,
title = {Fused Acoustic and Text Encoding for Multimodal Bilingual Pretraining and Speech Translation},
author = {Renjie Zheng and Junkun Chen and Mingbo Ma and Liang Huang},
journal= {arXiv preprint arXiv:2102.05766},
year = {2021}
}