中文

面向CTC语音识别的GPU加速WFST束搜索解码器

音频与语音处理 2023-11-10 v1 机器学习

摘要

尽管连接时序分类(Connectionist Temporal Classification, CTC)模型在自动语音识别(ASR)流水线中达到了最先进的准确率,其性能一直受限于基于CPU的束搜索解码。我们引入了一种与当前CTC模型兼容的GPU加速加权有限状态转录机(Weighted Finite State Transducer, WFST)束搜索解码器。它提升了流水线吞吐并降低延迟,支持流式推理,并支持如通过即时组合实现语句特定词增强等高级特性。我们在 https://github.com/nvidia-riva/riva-asrlib-decoder 提供了预构建的基于DLPack的python绑定,以便与基于Python的机器学习框架轻松集成。我们针对离线与在线场景评估了解码器,证明其是CTC模型最快的束搜索解码器。在离线场景中,其吞吐量达当前最先进CPU解码器的至多7倍;在线流式场景中,其延迟降低近8倍,且词错率相当或更优。

关键词

引用

@article{arxiv.2311.04996,
  title  = {GPU-Accelerated WFST Beam Search Decoder for CTC-based Speech Recognition},
  author = {Daniel Galvez and Tim Kaldewey},
  journal= {arXiv preprint arXiv:2311.04996},
  year   = {2023}
}