中文

迈向在线端到端Transformer自动语音识别

音频与语音处理 2019-10-29 v1 计算与语言 声音

摘要

Transformer自注意力网络近来作为循环神经网络在端到端(E2E)自动语音识别(ASR)系统中的替代方案展现出有前景的性能。然而,Transformer有一个缺点,即需要整个输入序列来计算自注意力。我们已通过引入上下文感知继承机制提出了一种用于Transformer编码器的块处理方法。从前一已处理块传递的额外上下文嵌入向量有助于编码不仅局部声学信息,还有全局语言、信道与说话人属性。在本文中,我们通过将受单调分块注意力(MoChA)启发的在线解码过程引入Transformer解码器,将其扩展为完整的在线E2E ASR系统。我们新颖的MoChA训练与推理算法利用了Transformer的独特性质:其注意力并非总是单调或尖锐的,且解码器层具有多个头与残差连接。对Wall Street Journal(WSJ)与AISHELL-1的评估表明,我们提出的在线Transformer解码器优于传统的分块方法。

关键词

引用

@article{arxiv.1910.11871,
  title  = {Towards Online End-to-end Transformer Automatic Speech Recognition},
  author = {Emiru Tsunoo and Yosuke Kashiwagi and Toshiyuki Kumakura and Shinji Watanabe},
  journal= {arXiv preprint arXiv:1910.11871},
  year   = {2019}
}

备注

arXiv admin note: text overlap with arXiv:1910.07204