基于神经换能器的大规模流式端到端语音翻译
计算与语言
2022-07-05 v2 音频与语音处理
摘要
神经换能器已广泛应用于自动语音识别(ASR)。在本文中,我们将其引入流式端到端语音翻译(ST),其旨在直接将音频信号转换为其他语言的文本。与执行ASR后再进行基于文本的机器翻译(MT)的级联ST相比,所提出的基于Transformer换能器(TT)的ST模型大幅降低了推理延迟,利用了语音信息,并避免了从ASR到MT的错误传播。为提高建模能力,我们针对TT中的联合网络提出了注意力池化。此外,我们将基于TT的ST扩展到多语言ST,可同时生成多种语言的文本。在大规模5万(K)小时伪标记训练集上的实验结果表明,基于TT的ST不仅显著减少了推理时间,而且在英德翻译上优于非流式级联ST。
引用
@article{arxiv.2204.05352,
title = {Large-Scale Streaming End-to-End Speech Translation with Neural Transducers},
author = {Jian Xue and Peidong Wang and Jinyu Li and Matt Post and Yashesh Gaur},
journal= {arXiv preprint arXiv:2204.05352},
year = {2022}
}
备注
The paper was submitted to Interspeech 2022