中文

面向自动语音识别的改进型噪声学生训练

音频与语音处理 2020-11-02 v2 机器学习

摘要

近来,一种称为“噪声学生训练”的半监督学习方法已被证明能显著提升深度网络的图像分类性能。噪声学生训练是一种迭代式自训练方法,利用数据增强来提升网络性能。在本工作中,我们针对自动语音识别对噪声学生训练进行了适配与改进,采用(自适应)SpecAugment 作为增强方法。我们找到了在自训练迭代之间生成的数据进行有效过滤、平衡与增强的方法。通过这样做,我们仅使用 LibriSpeech 中干净的 100h 子集作为有监督集、其余(860h)作为无标签集,便在干净/含噪 LibriSpeech 测试集上取得了 4.2%/8.6% 的词错误率(WER)。此外,我们使用 LibriLight 的 unlab-60k 子集作为 LibriSpeech 960h 的无标签集,能够在干净/含噪 LibriSpeech 测试集上达到 1.7%/3.4% 的 WER。因此,我们改进了此前 LibriSpeech 100h(4.74%/12.20%)与 LibriSpeech(1.9%/4.1%)所取得的最优干净/含噪测试 WER。

关键词

引用

@article{arxiv.2005.09629,
  title  = {Improved Noisy Student Training for Automatic Speech Recognition},
  author = {Daniel S. Park and Yu Zhang and Ye Jia and Wei Han and Chung-Cheng Chiu and Bo Li and Yonghui Wu and Quoc V. Le},
  journal= {arXiv preprint arXiv:2005.09629},
  year   = {2020}
}

备注

5 pages, 5 figures, 4 tables; v2: minor revisions, reference added