面向大规模数据集语音识别的实时流式 Transformer Transducer 开发
计算与语言
2021-03-02 v3 音频与语音处理
摘要
近年来,基于 Transformer 的端到端模型在包括语音识别在内的许多领域取得了巨大成功。然而,与 LSTM 模型相比,Transformer 在推理过程中的高昂计算成本是其应用面临的一个关键问题。在本工作中,我们探索了 Transformer Transducer(T-T)模型在大规模数据集上以低延迟和快速速度进行首遍解码的潜力。我们结合 Transformer-XL 与分块流式处理的思想,设计了一种可流式处理的 Transformer Transducer 模型。我们证明,在流式场景下,T-T 优于混合模型、RNN Transducer(RNN-T)以及可流式处理的 Transformer 基于注意力机制的编码器-解码器模型。此外,通过相对较小的前瞻(look-ahead),可以优化运行时成本与延迟。
引用
@article{arxiv.2010.11395,
title = {Developing Real-time Streaming Transformer Transducer for Speech Recognition on Large-scale Dataset},
author = {Xie Chen and Yu Wu and Zhenghao Wang and Shujie Liu and Jinyu Li},
journal= {arXiv preprint arXiv:2010.11395},
year = {2021}
}
备注
5 pages