中文

SpeechLM:利用非配对文本数据增强语音预训练

计算与语言 2023-06-16 v3 人工智能 音频与语音处理

摘要

如何利用文本数据增强语音预训练是一个尚未解决的问题,因为语音和文本是具有不同特征的截然不同的模态。在本文中,我们提出了一种跨模态语音与语言模型(SpeechLM),通过预定义的统一离散表示来显式对齐语音和文本预训练。具体而言,我们引入了两种可选的离散 tokenizer 来桥接语音和文本模态,包括音素单元(phoneme-unit)和隐单元(hidden-unit)tokenizer,它们可以使用少量的配对语音-文本数据进行训练。基于训练好的 tokenizer,我们将无标签的语音和文本数据转换为音素单元或隐单元的 token。预训练目标旨在使用统一的 Transformer 网络将语音和文本统一到相同的离散语义空间中。我们在包括语音识别、语音翻译和通用表示评估框架 SUPERB 在内的各种口语处理任务上评估了 SpeechLM,展示了在内容相关任务上的显著改进。代码和模型可在 https://aka.ms/SpeechLM 获取。

关键词

引用

@article{arxiv.2209.15329,
  title  = {SpeechLM: Enhanced Speech Pre-Training with Unpaired Textual Data},
  author = {Ziqiang Zhang and Sanyuan Chen and Long Zhou and Yu Wu and Shuo Ren and Shujie Liu and Zhuoyuan Yao and Xun Gong and Lirong Dai and Jinyu Li and Furu Wei},
  journal= {arXiv preprint arXiv:2209.15329},
  year   = {2023}
}

备注

We have corrected the errors in the pre-training data for SpeechLM-P Base models, new results are updated