中文

面向序列到序列语音识别的无监督预训练

声音 2020-01-03 v2 计算与语言 音频与语音处理

摘要

本文提出了一种新颖的方法,分别利用未配对的语音和转录文本对编码器-解码器序列到序列(seq2seq)模型进行预训练。我们的预训练方法分为两个阶段,称为声学预训练和语言预训练。在声学预训练阶段,我们使用大量语音,通过利用其上下文预测被掩码的语音特征块来预训练编码器。在语言预训练阶段,我们使用单说话人文本到语音(TTS)系统从大量转录文本生成合成语音,并利用合成配对数据预训练解码器。这种两阶段预训练方法将丰富的声学和语言知识整合到 seq2seq 模型中,有益于下游自动语音识别(ASR)任务。无监督预训练在 AISHELL-2 数据集上完成,我们将预训练模型应用于 AISHELL-1 和 HKUST 的多种配对数据比例。我们在 AISHELL-1 上获得了 38.24% 到 7.88% 的相对字符错误率降低(CERR),在 HKUST 上获得了 12.00% 到 1.20% 的相对字符错误率降低。此外,我们将预训练模型应用于 CALLHOME 数据集上的跨语言场景。对于 CALLHOME 数据集中的所有六种语言,我们的预训练方法使模型一致地优于基线。

关键词

引用

@article{arxiv.1910.12418,
  title  = {Unsupervised pre-training for sequence to sequence speech recognition},
  author = {Zhiyun Fan and Shiyu Zhou and Bo Xu},
  journal= {arXiv preprint arXiv:1910.12418},
  year   = {2020}
}