基于上下文分块处理的Transformer语音识别
音频与语音处理
2019-10-17 v1 计算与语言
摘要
Transformer自注意力网络作为循环神经网络(RNN)的替代方案,最近在端到端(E2E)自动语音识别(ASR)系统中展现出令人鼓舞的性能。然而,Transformer的一个缺点是计算自注意力需要整个输入序列。在本文中,我们通过引入一种上下文感知的继承机制,为Transformer编码器提出了一种新的分块处理方法。一个从前一个已处理块传递过来的额外上下文嵌入向量,不仅有助于编码局部声学信息,还有助于编码全局的语言、信道和说话人属性。我们引入了一种新颖的掩码技术来实现上下文继承,以高效地训练模型。在华尔街日报(WSJ)、Librispeech、VoxForge意大利语和AISHELL-1普通话语音识别数据集上的评估表明,我们提出的上下文分块处理方法始终优于朴素分块处理。此外,我们还分析了每一层的注意力权重趋势,以阐明所添加的上下文继承机制如何建模全局信息。
引用
@article{arxiv.1910.07204,
title = {Transformer ASR with Contextual Block Processing},
author = {Emiru Tsunoo and Yosuke Kashiwagi and Toshiyuki Kumakura and Shinji Watanabe},
journal= {arXiv preprint arXiv:1910.07204},
year = {2019}
}
备注
Accepted for ASRU 2019