Transformer Transducer:一种带有Transformer编码器与RNN-T损失的流式语音识别模型
音频与语音处理
2020-02-18 v2 计算与语言
声音
摘要
本文提出了一种带有Transformer编码器的端到端语音识别模型,可用于流式语音识别系统。基于自注意力的Transformer计算块被用来独立编码音频和标签序列。音频和标签编码器的激活通过一个前馈层组合,以针对声学帧位置和标签历史的每种组合计算标签空间上的概率分布。这类似于循环神经网络转导器(RNN-T)模型,后者使用RNN而非Transformer编码器进行信息编码。该模型使用非常适合流式解码的RNN-T损失进行训练。我们在LibriSpeech数据集上给出的结果表明,限制Transformer层中自注意力的左上下文使得解码在计算上对流式处理可行,且仅带来轻微的精度下降。我们还展示了我们模型的全注意力版本在LibriSpeech基准上击败了最先进的精度。我们的结果还表明,通过关注有限数量的未来帧,我们可以弥合模型全注意力与有限注意力版本之间的差距。
引用
@article{arxiv.2002.02562,
title = {Transformer Transducer: A Streamable Speech Recognition Model with Transformer Encoders and RNN-T Loss},
author = {Qian Zhang and Han Lu and Hasim Sak and Anshuman Tripathi and Erik McDermott and Stephen Koo and Shankar Kumar},
journal= {arXiv preprint arXiv:2002.02562},
year = {2020}
}
备注
This is the final version of the paper submitted to the ICASSP 2020 on Oct 21, 2019