中文

GPU上RNN-T语音识别模型的光速精确贪心解码

机器学习 2024-06-07 v1

摘要

目前,RNN Transducer(RNN-T)模型的绝大部分推理时间都花在解码上。当前最先进的RNN-T解码实现使GPU大约80%的时间处于空闲状态。利用CUDA 12.4的新特性——CUDA图条件节点,我们提出了一种基于GPU的精确贪心解码实现,用于RNN-T模型,消除了这种空闲时间。我们的优化将1.1亿参数的RNN-T模型端到端速度提升了2.5倍。该技术同样可应用于“标签循环”替代贪心解码算法,当应用于1.1亿参数的RNN-T模型和Token and Duration Transducer模型时,分别实现了1.7倍和1.4倍的端到端加速。这项工作使得1.1亿参数的RNN-T模型运行速度仅比同等规模的CTC模型慢16%,这与RNN-T模型不适合高吞吐量推理的普遍看法相矛盾。该实现已在NVIDIA NeMo中提供。

关键词

引用

@article{arxiv.2406.03791,
  title  = {Speed of Light Exact Greedy Decoding for RNN-T Speech Recognition Models on GPU},
  author = {Daniel Galvez and Vladimir Bataev and Hainan Xu and Tim Kaldewey},
  journal= {arXiv preprint arXiv:2406.03791},
  year   = {2024}
}

备注

Interspeech 2024 Proceedings