中文

SpeechUT:以隐单元桥接语音与文本的统一模态编码器-解码器语音-文本预训练模型

计算与语言 2022-10-10 v1 音频与语音处理

摘要

单模态预训练快速发展,促使研究者更加关注跨模态预训练方法。本文中,我们提出一种统一模态的语音-单元-文本预训练模型 SpeechUT,通过共享的单元编码器连接语音编码器与文本解码器的表示。利用隐单元作为对齐语音与文本的接口,我们可以将语音到文本模型分解为语音到单元模型与单元到文本模型,二者可分别使用非配对的语音与文本数据联合预训练。我们提出的 SpeechUT 在自动语音识别(ASR)与语音翻译(ST)任务上进行了微调与评估。实验结果表明,SpeechUT 相较强基线获得显著提升,并在 LibriSpeech ASR 与 MuST-C ST 任务上均达到最先进(state-of-the-art)性能。为更好理解所提出的 SpeechUT,我们进行了详细分析。代码与预训练模型可在 https://aka.ms/SpeechUT 获取。

关键词

引用

@article{arxiv.2210.03730,
  title  = {SpeechUT: Bridging Speech and Text with Hidden-Unit for Encoder-Decoder Based Speech-Text Pre-training},
  author = {Ziqiang Zhang and Long Zhou and Junyi Ao and Shujie Liu and Lirong Dai and Jinyu Li and Furu Wei},
  journal= {arXiv preprint arXiv:2210.03730},
  year   = {2022}
}

备注

14 pages, accepted by EMNLP 2022