Uconv-Conformer:用于端到端语音识别的输入序列长度高度缩减
音频与语音处理
2023-03-14 v3 机器学习
声音
摘要
现代 ASR(自动语音识别)架构的优化是最高优先级任务之一,因其可节省大量模型训练与推理的计算资源。本工作提出一种基于标准 Conformer 模型的新架构 Uconv-Conformer。它一致地将输入序列长度缩减 16 倍,从而加速中间层的工作。为解决因时间维度如此大幅缩减带来的收敛问题,我们使用如 U-Net 架构中的上采样块以确保正确的 CTC 损失计算并稳定网络训练。Uconv-Conformer 架构不仅训练和推理速度更快,而且相比基线 Conformer 展现出更优的 WER(词错率)。我们最佳的 Uconv-Conformer 模型在 CPU 和 GPU 上分别显示出 47.8% 和 23.5% 的推理加速。在 LibriSpeech test_clean 和 test_other 上相对 WER 降低分别为 7.3% 和 9.2%。
引用
@article{arxiv.2208.07657,
title = {Uconv-Conformer: High Reduction of Input Sequence Length for End-to-End Speech Recognition},
author = {Andrei Andrusenko and Rauf Nasretdinov and Aleksei Romanenko},
journal= {arXiv preprint arXiv:2208.07657},
year = {2023}
}
备注
5 pages, 1 figure, accepted by ICASSP 2023