中文

SpeechStew:简单混合所有可用语音识别数据以训练一个大型神经网络

计算与语言 2021-04-28 v3 机器学习

摘要

我们提出 SpeechStew,一种在多个公开可用语音识别数据集组合上训练的语音识别模型:AMI、Broadcast News、Common Voice、LibriSpeech、Switchboard/Fisher、Tedlium 和 Wall Street Journal。SpeechStew 简单地将这些数据集混合在一起,而不对任何数据集做特殊的重加权或重平衡。SpeechStew 在多种任务上取得了 SOTA 或接近 SOTA 的结果,且未使用外部语言模型。我们的结果包括 AMI-IHM 上 9.0% WER、Switchboard 上 4.7% WER、CallHome 上 8.3% WER 以及 WSJ 上 1.3% WER,显著优于使用强外部语言模型的先前工作。我们还证明 SpeechStew 学到了强大的迁移学习表示。我们在含噪低资源语音数据集 CHiME-6 上微调 SpeechStew。我们在无语言模型时取得 38.9% WER,相对于带语言模型的强 HMM 基线 38.6% WER。

关键词

引用

@article{arxiv.2104.02133,
  title  = {SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network},
  author = {William Chan and Daniel Park and Chris Lee and Yu Zhang and Quoc Le and Mohammad Norouzi},
  journal= {arXiv preprint arXiv:2104.02133},
  year   = {2021}
}

备注

submitted to INTERSPEECH