中文

SynthASR:释放合成数据在语音识别中的潜力

机器学习 2021-06-16 v1 声音 音频与语音处理

摘要

端到端(E2E)自动语音识别(ASR)模型近来已展示出优于传统混合 ASR 模型的性能。训练 E2E ASR 模型需要大量数据,这不仅昂贵,还可能增加对生产数据的依赖。同时,由最优(SOTA)文本转语音(TTS)引擎生成的合成语音已发展到接近人类自然度。在这项工作中,我们提出在 ASR 训练数据稀疏或难以获取的应用中利用合成语音进行 ASR 训练(SynthASR)。此外,我们应用带有新颖多阶段训练策略的持续学习来解决灾难性遗忘问题,该策略通过加权多风格训练、数据增强、编码器冻结和参数正则化的混合来实现。在我们使用内部数据集进行的识别药物名称新应用的实验中,通过所提出的多阶段训练用合成音频训练 ASR RNN-T 模型,将新应用上的识别性能相对提升了超过 65%,且在现有通用应用上无性能下降。我们的观察表明,SynthASR 在训练新应用的最优大规模 E2E ASR 模型方面大有前景,同时降低了对生产数据的成本和依赖。

关键词

引用

@article{arxiv.2106.07803,
  title  = {SynthASR: Unlocking Synthetic Data for Speech Recognition},
  author = {Amin Fazel and Wei Yang and Yulan Liu and Roberto Barra-Chicote and Yixiong Meng and Roland Maas and Jasha Droppo},
  journal= {arXiv preprint arXiv:2106.07803},
  year   = {2021}
}

备注

Accepted to Interspeech 2021