LAMASSU:基于神经换能器的流式语言无关多语种语音识别与翻译
计算与语言
2023-10-23 v3 声音
音频与语音处理
摘要
自动语音识别(ASR)与语音翻译(ST)均可采用神经换能器作为模型结构。因此,使用单一换能器模型完成这两项任务是可行的。在实际应用中,此类联合ASR与ST模型可能需要具备流式处理能力,且无需源语言识别(即语言无关)。本文提出LAMASSU,一种基于神经换能器的流式语言无关多语种语音识别与翻译模型。在换能器模型结构基础上,我们提出四种方法:用于多语种输出的统一联合与预测网络、聚类多语种编码器、面向编码器的目标语言识别,以及连接主义时序分类正则化。实验结果表明,LAMASSU不仅大幅缩减了模型规模,还达到了单语种ASR与双语种ST模型的性能。
引用
@article{arxiv.2211.02809,
title = {LAMASSU: Streaming Language-Agnostic Multilingual Speech Recognition and Translation Using Neural Transducers},
author = {Peidong Wang and Eric Sun and Jian Xue and Yu Wu and Long Zhou and Yashesh Gaur and Shujie Liu and Jinyu Li},
journal= {arXiv preprint arXiv:2211.02809},
year = {2023}
}
备注
INTERSPEECH 2023