中文

RWTH 面向 TED-LIUM Release 2 的 ASR 系统:利用 SpecAugment 改进混合 HMM

音频与语音处理 2020-04-03 v1 声音

摘要

我们提出了一套完整的训练流程,用于在 TED-LIUM 语料库第 2 版上构建最先进的基于混合 HMM 的 ASR 系统。在数据增强方面,成功应用 SpecAugment 以改进我们基于 i-vector 的最佳 SAT 模型性能。通过研究不同掩蔽方式的影响,我们在不增加模型规模和训练时间的情况下,于混合 HMM 模型上借助 SpecAugment 取得了改进。随后应用 sMBR 训练对最终声学模型进行微调,并训练与评估了 LSTM 和 Transformer 语言模型。我们的最佳系统在测试集上取得了 5.6% 的 WER,相对此前最先进水平提升了 27%。

关键词

引用

@article{arxiv.2004.00960,
  title  = {The RWTH ASR System for TED-LIUM Release 2: Improving Hybrid HMM with SpecAugment},
  author = {Wei Zhou and Wilfried Michel and Kazuki Irie and Markus Kitza and Ralf Schlüter and Hermann Ney},
  journal= {arXiv preprint arXiv:2004.00960},
  year   = {2020}
}

备注

accepted at ICASSP 2020