Mu$^{2}$SLAM:多任务、多语言语音与语言模型
计算与语言
2023-06-28 v2 声音
音频与语音处理
摘要
我们提出了MuSLAM,这是一个多语言序列到序列模型,联合预训练于无标签语音、无标签文本以及涵盖自动语音识别(ASR)、自动语音翻译(AST)和机器翻译(MT)的监督数据,涉及超过100种语言。通过利用语音的量化表示作为目标,MuSLAM训练语音-文本模型时,在解码器上采用类似于T5的序列到序列掩码去噪目标,在编码器上采用掩码语言建模(MLM)目标,同时处理无监督语音和文本,并利用监督任务来改进模型内的跨语言和跨模态表示对齐。在CoVoST AST任务上,MuSLAM为在公共数据集上训练的模型建立了新的最优水平,在xx-en翻译上比之前的最佳结果提高了1.9个BLEU点,在en-xx翻译上提高了1.1个BLEU点。在Voxpopuli ASR任务上,尽管使用了相对较弱的序列到序列架构,我们的模型性能与使用RNN-T解码器微调的mSLAM模型相当。在文本理解任务上,我们的模型在XNLI上比mSLAM提高了超过6%,在XNLI和TydiQA上更接近具有可比容量的mT5模型的性能,为所有语音和文本理解任务使用单一模型铺平了道路。
引用
@article{arxiv.2212.09553,
title = {Mu$^{2}$SLAM: Multitask, Multilingual Speech and Language Models},
author = {Yong Cheng and Yu Zhang and Melvin Johnson and Wolfgang Macherey and Ankur Bapna},
journal= {arXiv preprint arXiv:2212.09553},
year = {2023}
}
备注
ICML 2023