中文

使用带扩张一维卷积的多流自注意力实现最先进的语音识别

计算与语言 2019-10-03 v1 声音 音频与语音处理

摘要

自注意力在 NLP 的许多下游任务中取得了巨大成功,这促使人们探索将自注意力应用于语音问题。然而,自注意力在语音应用中的功效似乎尚未充分发挥,因为在自注意力上下文中处理高度相关的语音帧具有挑战性。在本文中,我们提出一种新的神经网络模型架构,即多流自注意力,以解决该问题从而使自注意力机制对语音识别更为有效。所提模型架构由并行的自注意力编码器流组成,每个流具有带扩张核的一维卷积层(其扩张率在给定的流中唯一),随后是一个自注意力层。每个流中的自注意力机制仅关注输入语音帧的一种分辨率,且注意力计算可更为高效。在后续阶段,所有流的输出被拼接然后线性投影到最终嵌入。通过堆叠所提多流自注意力编码器块并使用神经网络语言模型对所得词格进行重打分,我们在 LibriSpeech 语料的 test-clean 数据集上实现了 2.2% 的词错误率,这是该数据集上迄今报道的最佳数值。

关键词

引用

@article{arxiv.1910.00716,
  title  = {State-of-the-Art Speech Recognition Using Multi-Stream Self-Attention With Dilated 1D Convolutions},
  author = {Kyu J. Han and Ramon Prieto and Kaixing Wu and Tao Ma},
  journal= {arXiv preprint arXiv:1910.00716},
  year   = {2019}
}

备注

Accepted to ASRU 2019