基于因子化神经转换器的高级长内容语音识别
声音
2024-03-21 v1 音频与语音处理
摘要
本文提出了两种新型方法,将长内容信息整合到基于因子化神经转换器 (FNT) 的架构中,分别适用于非流式(称为 LongFNT)和流式(称为 SLongFNT)场景。我们首先研究是否可以使用长内容转录来提高基础 conformer transducer (C-T) 模型的性能。我们的实验表明,基础 C-T 模型在利用长内容转录时并未表现出改进性能,这可能是由于 C-T 模型的预测网络未作为纯语言模型发挥作用。相反,FNT 在利用长内容信息方面展现了潜力,我们提出了 LongFNT 模型,并探讨了长内容信息在文本(LongFNT-Text)和语音(LongFNT-Speech)中的影响。所提出的 LongFNT-Text 和 LongFNT-Speech 模型相互补充,以获得更好的性能,转录历史对模型的价值更大。我们在 LibriSpeech 和 GigaSpeech 数据集上评估了 LongFNT 方法的有效性,分别实现了约 19% 和 12% 的词错误率 (WER) 降低。此外,我们将 LongFNT 模型扩展到流式场景,命名为 SLongFNT,包含 SLongFNT-Text 和 SLongFNT-Speech 两种方法以利用长内容文本和语音信息。实验表明,所提出的 SLongFNT 模型在 LibriSpeech 和 GigaSpeech 上的相对 WER 分别降低了 26% 和 17%,同时保持了良好的延迟性能。总体而言,所提出的 LongFNT 和 SLongFNT 凸显了在提高非流式和流式语音识别系统性能方面考虑长内容语音和转录知识的重要性。
引用
@article{arxiv.2403.13423,
title = {Advanced Long-Content Speech Recognition With Factorized Neural Transducer},
author = {Xun Gong and Yu Wu and Jinyu Li and Shujie Liu and Rui Zhao and Xie Chen and Yanmin Qian},
journal= {arXiv preprint arXiv:2403.13423},
year = {2024}
}
备注
Accepted by TASLP 2024