一种具备真正零样本能力的弱监督流式多语言语音模型
计算与语言
2023-07-07 v2 人工智能
声音
音频与语音处理
摘要
本文介绍我们构建流式多语言语音模型(SM2)的工作,该模型可将多种口语转录或翻译为目标语言文本。SM2 的骨干为具有高通流能力的 Transformer Transducer。SM2 模型不使用人工标注的语音翻译(ST)数据,而是利用机器翻译服务将语音识别语料中的转写文本转换生成的弱监督数据进行训练。借助来自 25 种语言的 35.1 万小时匿名语音训练数据,SM2 模型取得了与某些近期流行的大规模非流式语音模型相当甚至更优的 ST 质量。更重要的是,我们展示了 SM2 在扩展到新目标语言时具备真正的零样本能力,可为训练期间未见的 {源语音,目标文本} 对生成高质量 ST 结果。
引用
@article{arxiv.2211.02499,
title = {A Weakly-Supervised Streaming Multilingual Speech Model with Truly Zero-Shot Capability},
author = {Jian Xue and Peidong Wang and Jinyu Li and Eric Sun},
journal= {arXiv preprint arXiv:2211.02499},
year = {2023}
}