中文

用于端到端语音识别的极深自注意力网络

计算与语言 2019-05-06 v2 机器学习 声音 音频与语音处理

摘要

近来,用于语音识别的端到端序列到序列模型在研究界获得了显著关注。尽管以往的架构选择围绕时延神经网络(TDNN)和长短期记忆(LSTM)循环神经网络展开,我们提出使用 Transformer 架构中的自注意力作为替代方案。我们的分析表明,具有高学习容量的深度 Transformer 网络能够超越以往端到端方法的性能,甚至可与常规混合系统相匹敌。此外,我们训练了极深模型,其编码器与解码器最多达 48 层 Transformer 层,并结合随机残差连接,这极大提升了泛化能力与训练效率。所得模型在 Switchboard 基准上优于所有以往的端到端 ASR 方法。这些模型的集成在 Switchboard 和 CallHome 测试集上分别取得了 9.9% 和 17.7% 的 WER。这一发现使我们的端到端模型达到与以往混合系统竞争的水平。进一步,通过模型集成,Transformer 可优于某些在结构与训练流程上更为复杂的混合系统。

关键词

引用

@article{arxiv.1904.13377,
  title  = {Very Deep Self-Attention Networks for End-to-End Speech Recognition},
  author = {Ngoc-Quan Pham and Thai-Son Nguyen and Jan Niehues and Markus Müller and Sebastian Stüker and Alexander Waibel},
  journal= {arXiv preprint arXiv:1904.13377},
  year   = {2019}
}

备注

Submitted to INTERSPEECH 2019