中文

ASAPP-ASR:用于 SOTA 语音识别的多流 CNN 与自注意力 SRU

音频与语音处理 2020-05-22 v1 计算与语言 声音

摘要

本文中,我们借助两种新颖的神经网络架构在 LibriSpeech 语料库上取得了当前最优(SOTA)性能:用于声学建模的多流 CNN 和用于语言建模的自注意力简单循环单元(SRU)。在混合 ASR 框架中,多流 CNN 声学模型以多个并行流水线处理语音帧输入,其中每个流具有独特的膨胀率以实现多样性。使用 SpecAugment 数据增强方法训练,其在 test-clean 上实现了 4% 的相对词错率(WER)提升,在 test-other 上实现了 14% 的提升。我们通过使用 24 层自注意力 SRU 语言模型进行 N-best 重打分进一步改进性能,在 test-clean 上取得 1.75% 的 WER,在 test-other 上取得 4.46% 的 WER。

关键词

引用

@article{arxiv.2005.10469,
  title  = {ASAPP-ASR: Multistream CNN and Self-Attentive SRU for SOTA Speech Recognition},
  author = {Jing Pan and Joshua Shapiro and Jeremy Wohlwend and Kyu J. Han and Tao Lei and Tao Ma},
  journal= {arXiv preprint arXiv:2005.10469},
  year   = {2020}
}

备注

Submitted to Interspeech 2020