中文

无需更多数据:通过文本转语音数据增强改进端到端语音识别

音频与语音处理 2020-12-21 v2 计算与语言 机器学习 声音

摘要

数据增强是使端到端自动语音识别(ASR)性能接近传统混合方法的最有效途径之一,尤其是在处理低资源任务时。利用语音合成(文本转语音,TTS)的最新进展,我们在 ASR 训练数据库上构建 TTS 系统,然后用合成语音扩展数据以训练识别模型。我们认为,当训练数据量相对较低时,该方法可使端到端模型达到混合系统的质量。针对人工低到中资源设置,我们将所提出的增强方法与半监督学习技术进行比较。我们还通过比较 Griffin-Lim 算法与我们改进的 LPCNet 来研究声码器使用对最终 ASR 性能的影响。当配合外部语言模型使用时,我们的方法在 LibriSpeech test-clean 上优于半监督设置,且仅比可比的监督设置差 33%。我们的系统在 LibriSpeech train-clean-100 集上训练的端到端 ASR 取得了具有竞争力的结果,test-clean 词错率(WER)为 4.3%,test-other 为 13.5%。

关键词

引用

@article{arxiv.2005.07157,
  title  = {You Do Not Need More Data: Improving End-To-End Speech Recognition by Text-To-Speech Data Augmentation},
  author = {Aleksandr Laptev and Roman Korostik and Aleksey Svischev and Andrei Andrusenko and Ivan Medennikov and Sergey Rybin},
  journal= {arXiv preprint arXiv:2005.07157},
  year   = {2020}
}