具有时间-深度可分离卷积的序列到序列语音识别
计算与语言
2019-04-05 v1
摘要
我们提出了一种全卷积的序列到序列编码器架构,并配以简单高效的解码器。我们的模型在 LibriSpeech 上降低了词错率(WER),同时比一个强 RNN 基线高效一个数量级。我们方法的关键在于时间-深度可分离卷积块,其在保持大感受野的同时显著减少了模型参数量。我们还给出了一种稳定高效的集束搜索推理过程,使我们能够有效集成语言模型。结合卷积语言模型,我们的时间-深度可分离卷积架构相比此前报道的最佳序列到序列结果在含噪 LibriSpeech 测试集上相对降低了超过 22% 的 WER。
引用
@article{arxiv.1904.02619,
title = {Sequence-to-Sequence Speech Recognition with Time-Depth Separable Convolutions},
author = {Awni Hannun and Ann Lee and Qiantong Xu and Ronan Collobert},
journal= {arXiv preprint arXiv:1904.02619},
year = {2019}
}