SpeechT5:用于口语语言处理的统一模态编码器-解码器预训练
音频与语音处理
2022-05-25 v3 计算与语言
机器学习
声音
摘要
受 T5(Text-To-Text Transfer Transformer)在预训练自然语言处理模型中成功的启发,我们提出一种统一模态的 SpeechT5 框架,探索用于自监督语音/文本表示学习的编码器-解码器预训练。SpeechT5 框架由一个共享编码器-解码器网络与六个模态专用(语音/文本)前/后处理网络组成。经前处理网络对输入语音/文本预处理后,共享编码器-解码器网络对序列到序列变换建模,随后后处理网络基于解码器输出生成语音/文本模态的输出。利用大规模无标注语音与文本数据,我们预训练 SpeechT5 以学习统一模态表示,期望提升对语音与文本的建模能力。为将文本与语音信息对齐至该统一语义空间,我们提出一种跨模态向量量化方法,将语音/文本状态与潜单元随机混合作为编码器与解码器之间的接口。大量评估表明,所提 SpeechT5 框架在多种口语语言处理任务上具有优越性,包括自动语音识别、语音合成、语音翻译、语音转换、语音增强与说话人识别。我们在 https://github.com/microsoft/SpeechT5 发布代码与模型。
引用
@article{arxiv.2110.07205,
title = {SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing},
author = {Junyi Ao and Rui Wang and Long Zhou and Chengyi Wang and Shuo Ren and Yu Wu and Shujie Liu and Tom Ko and Qing Li and Yu Zhang and Zhihua Wei and Yao Qian and Jinyu Li and Furu Wei},
journal= {arXiv preprint arXiv:2110.07205},
year = {2022}
}
备注
Accepted by ACL 2022 main conference