中文

具有时间-深度可分离卷积的序列到序列语音识别

计算与语言 2019-04-05 v1

摘要

我们提出了一种全卷积的序列到序列编码器架构,并配以简单高效的解码器。我们的模型在 LibriSpeech 上降低了词错率(WER),同时比一个强 RNN 基线高效一个数量级。我们方法的关键在于时间-深度可分离卷积块,其在保持大感受野的同时显著减少了模型参数量。我们还给出了一种稳定高效的集束搜索推理过程,使我们能够有效集成语言模型。结合卷积语言模型,我们的时间-深度可分离卷积架构相比此前报道的最佳序列到序列结果在含噪 LibriSpeech 测试集上相对降低了超过 22% 的 WER。

关键词

引用

@article{arxiv.1904.02619,
  title  = {Sequence-to-Sequence Speech Recognition with Time-Depth Separable Convolutions},
  author = {Awni Hannun and Ann Lee and Qiantong Xu and Ronan Collobert},
  journal= {arXiv preprint arXiv:1904.02619},
  year   = {2019}
}