MAM:面向端到端语音到文本翻译的掩码声学建模
计算与语言
2021-02-10 v2
摘要
端到端语音到文本翻译 (E2E-ST) 直接将源语言语音翻译为目标语言文本,在实践中应用广泛,但传统的级联方法 (ASR+MT) 常受限于流水线中的错误传播。另一方面,现有的端到端方案严重依赖源语言转写文本,以进行自动语音识别 (ASR) 的预训练或多任务训练。我们转而提出一种简单的技术,仅以自监督方式在语音侧学习鲁棒的语音编码器,其可利用无转写文本的语音数据。该技术称为掩码声学建模 (Masked Acoustic Modeling, MAM),不仅为改进 E2E-ST 提供了替代方案,还可对任意声学信号(包括非语音信号)进行无标注预训练。我们在 8 个不同的翻译方向上开展实验。在不使用任何转写文本的设置下,我们的技术取得了平均 +1.1 BLEU 的提升,结合 MAM 预训练则提升 +2.3 BLEU。使用任意声学信号进行 MAM 预训练,对这些语言也带来了平均 +1.6 BLEU 的提升。相较于依赖训练时转写文本的多任务 ASR 学习方案,我们经预训练的 MAM 模型虽不使用转写文本,却取得了相近的准确率。
引用
@article{arxiv.2010.11445,
title = {MAM: Masked Acoustic Modeling for End-to-End Speech-to-Text Translation},
author = {Junkun Chen and Mingbo Ma and Renjie Zheng and Liang Huang},
journal= {arXiv preprint arXiv:2010.11445},
year = {2021}
}
备注
12 pages