中文

基于跨模态渐进训练的端到端语音翻译

计算与语言 2021-06-21 v2

摘要

端到端语音翻译模型因有望减少错误传播而成为研究新趋势。然而,这些模型仍受数据稀缺问题困扰。如何有效利用机器翻译中的无标注或其他平行语料库虽有前景但仍是一个开放问题。本文提出跨语音-文本网络(XSTNet),一种用于语音到文本翻译的端到端模型。XSTNet 以语音和文本为输入,输出转写文本与翻译文本。该模型得益于三个关键设计:作为音频编码器的自监督预训练子网络、利用额外平行双语文本的多任务训练目标,以及渐进式训练流程。我们在 MuST-C En-X 和 LibriSpeech En-Fr 数据集上评估了 XSTNet 与基线的性能。特别地,XSTNet 在所有语言方向上均取得最先进(state-of-the-art)结果,平均 BLEU 达 28.8,比先前最佳方法高出 3.2 BLEU。代码、模型、案例及更详细分析见 https://github.com/ReneeYe/XSTNet。

关键词

引用

@article{arxiv.2104.10380,
  title  = {End-to-end Speech Translation via Cross-modal Progressive Training},
  author = {Rong Ye and Mingxuan Wang and Lei Li},
  journal= {arXiv preprint arXiv:2104.10380},
  year   = {2021}
}

备注

Accepted at InterSpeech2021