Citrinet:缩小非自回归与自回归端到端自动语音识别模型之间的差距
音频与语音处理
2021-04-06 v1
摘要
我们提出了 Citrinet——一种基于卷积连接时序分类(CTC)的新型端到端自动语音识别(ASR)模型。Citrinet 是使用一维时间-通道可分离卷积结合子词编码和挤压激励(squeeze-and-excitation)的深度残差神经模型。所得架构显著缩小了非自回归模型与序列到序列及 transducers 模型之间的差距。我们在 LibriSpeech、TED-LIUM2、AISHELL-1 和多语种 LibriSpeech(MLS)英语语音数据集上评估了 Citrinet。Citrinet 在这些数据集上的准确率接近最佳的自回归 Transducer 模型。
引用
@article{arxiv.2104.01721,
title = {Citrinet: Closing the Gap between Non-Autoregressive and Autoregressive End-to-End Models for Automatic Speech Recognition},
author = {Somshubra Majumdar and Jagadeesh Balam and Oleksii Hrinchuk and Vitaly Lavrukhin and Vahid Noroozi and Boris Ginsburg},
journal= {arXiv preprint arXiv:2104.01721},
year = {2021}
}