中文

堆叠声学-文本编码:将预训练模型集成到语音翻译编码器中

计算与语言 2021-06-16 v2 声音 音频与语音处理

摘要

鉴于语音到翻译数据稀缺,编码器预训练在端到端语音翻译(ST)中颇具前景。但 ST 编码器并非自动语音识别(ASR)或机器翻译(MT)编码器的简单实例。例如,我们发现 ASR 编码器缺乏翻译所必需的全局上下文表示,而 MT 编码器并非设计用于处理长但局部注意的声学序列。本工作中,我们提出一种用于语音翻译的堆叠声学-文本编码(SATE)方法。我们的编码器像往常一样从处理声学序列开始,但随后表现得更像 MT 编码器以得到输入序列的全局表示。如此一来,将预训练模型集成到系统中便十分直接。此外,我们开发了适配模块以缓解预训练 ASR 编码器与 MT 编码器之间的表示不一致,并开发了多教师知识蒸馏方法以保留预训练知识。在 LibriSpeech En-Fr 与 MuST-C En-De ST 任务上的实验结果表明,我们的方法取得了 18.3 和 25.2 的 SOTA BLEU 分数。据我们所知,我们首个开发了端到端 ST 系统,在具备大规模 ASR 与 MT 数据时取得可与级联 ST 系统相比甚至更优的 BLEU 性能。

关键词

引用

@article{arxiv.2105.05752,
  title  = {Stacked Acoustic-and-Textual Encoding: Integrating the Pre-trained Models into Speech Translation Encoders},
  author = {Chen Xu and Bojie Hu and Yanyang Li and Yuhao Zhang and shen huang and Qi Ju and Tong Xiao and Jingbo Zhu},
  journal= {arXiv preprint arXiv:2105.05752},
  year   = {2021}
}

备注

ACL 2021