面向批处理在线与离线语音识别的GPU加速Viterbi精确格解码器
计算与语言
2020-02-17 v2 音频与语音处理
摘要
我们提出了一种优化的加权有限状态转换器(WFST)解码器,能够利用图形处理单元(GPU)进行音频的在线流式处理和离线批处理。该解码器在内存利用、输入/输出(I/O)带宽方面高效,并使用了一种旨在最大化并行度的新颖Viterbi实现。减少的内存占用使解码器能够处理比先前可能的大得多的图,而优化I/O增加了所支持的同时流数量。格段上的GPU预处理使得在流式推理期间可将中间格结果返回给请求方。总体而言,所提算法相比单核CPU解码实现了高达240倍的加速,且比当前最先进的GPU解码器快高达40倍,同时返回等价结果。该解码器设计使得生产级ASR模型能够部署在从大型数据中心服务器到低功耗边缘设备的广泛系统上。
引用
@article{arxiv.1910.10032,
title = {GPU-Accelerated Viterbi Exact Lattice Decoder for Batched Online and Offline Speech Recognition},
author = {Hugo Braun and Justin Luitjens and Ryan Leary and Tim Kaldewey and Daniel Povey},
journal= {arXiv preprint arXiv:1910.10032},
year = {2020}
}
备注
Accepted to ICASSP 2020