“听、理解、翻译”:三重监督解耦端到端语音到文本翻译
计算与语言
2021-04-06 v3 音频与语音处理
摘要
端到端语音到文本翻译(ST)接收源语言音频并输出目标语言文本。现有方法受限于平行语料库的数量。我们能否构建一个系统以充分利用平行ST语料库中的信号?我们受由听觉感知与认知处理组成的人类理解系统启发。本文提出Listen-Understand-Translate(LUT),一种具有三重监督信号的统一框架,用于解耦端到端语音到文本翻译任务。LUT能够引导声学编码器从听觉输入中提取尽可能多的信息。此外,LUT利用预训练的BERT模型迫使上层编码器产生尽可能多的语义信息,而无需额外数据。我们在多个不同的语音翻译基准上进行了实验,包括Librispeech英法语、IWSLT英德语和TED英汉语。我们的结果表明LUT达到了最先进的性能,优于先前的方法。代码见https://github.com/dqqcasia/st。
引用
@article{arxiv.2009.09704,
title = {"Listen, Understand and Translate": Triple Supervision Decouples End-to-end Speech-to-text Translation},
author = {Qianqian Dong and Rong Ye and Mingxuan Wang and Hao Zhou and Shuang Xu and Bo Xu and Lei Li},
journal= {arXiv preprint arXiv:2009.09704},
year = {2021}
}
备注
Accepted by AAAI 2021