中文

基于神经换能器的大规模流式端到端语音翻译

计算与语言 2022-07-05 v2 音频与语音处理

摘要

神经换能器已广泛应用于自动语音识别(ASR)。在本文中,我们将其引入流式端到端语音翻译(ST),其旨在直接将音频信号转换为其他语言的文本。与执行ASR后再进行基于文本的机器翻译(MT)的级联ST相比,所提出的基于Transformer换能器(TT)的ST模型大幅降低了推理延迟,利用了语音信息,并避免了从ASR到MT的错误传播。为提高建模能力,我们针对TT中的联合网络提出了注意力池化。此外,我们将基于TT的ST扩展到多语言ST,可同时生成多种语言的文本。在大规模5万(K)小时伪标记训练集上的实验结果表明,基于TT的ST不仅显著减少了推理时间,而且在英德翻译上优于非流式级联ST。

关键词

引用

@article{arxiv.2204.05352,
  title  = {Large-Scale Streaming End-to-End Speech Translation with Neural Transducers},
  author = {Jian Xue and Peidong Wang and Jinyu Li and Matt Post and Yashesh Gaur},
  journal= {arXiv preprint arXiv:2204.05352},
  year   = {2022}
}

备注

The paper was submitted to Interspeech 2022