用于语音识别的多空白转录器
音频与语音处理
2024-04-15 v2 机器学习
声音
摘要
本文提出对用于自动语音识别(ASR)的 RNN-Transducer(RNN-T)模型的改进。在标准 RNN-T 中,空白符号的发射恰好消耗一帧输入;在我们提出的方法中,我们引入额外的空白符号,其在发射时消耗两帧或更多输入帧。我们将所添加的符号称为大空白(big blank),该方法称为多空白 RNN-T。为训练多空白 RNN-T,我们提出一种新颖的 logit 欠规范化方法,以优先发射大空白。通过在多种语言与数据集上的实验,我们表明多空白 RNN-T 方法可为英语 Librispeech 与德语 Multilingual Librispeech 数据集分别带来超过 +90%/+139% 的相对推理加速。多空白 RNN-T 方法也一致地提升了 ASR 准确率。我们将在 NeMo(https://github.com/NVIDIA/NeMo)工具包中发布该方法的实现。
引用
@article{arxiv.2211.03541,
title = {Multi-blank Transducers for Speech Recognition},
author = {Hainan Xu and Fei Jia and Somshubra Majumdar and Shinji Watanabe and Boris Ginsburg},
journal= {arXiv preprint arXiv:2211.03541},
year = {2024}
}