通过端到端4比特量化加速循环神经网络换能器的推理与语言模型融合
计算与语言
2022-06-17 v1 机器学习
声音
音频与语音处理
摘要
我们报告了极大加速循环神经网络换能器(RNN-T)推理的激进量化策略。我们对权重和激活均使用4比特整数表示,并应用量化感知训练(QAT)重新训练完整模型(声学编码器与语言模型),实现了近乎同精度。我们表明,针对网络局部特性定制的量化方案对于在限制QAT计算开销的同时获得良好性能至关重要。密度比语言模型融合在RNN-T任务上已显示出显著的精度提升,但严重增加了推理的计算成本。我们表明,我们的量化策略能够使用大束宽进行假设搜索,同时实现流兼容的运行时间,以及与全精度模型相比7.6×的完整模型压缩比。通过硬件仿真,我们估计端到端量化RNN-T(含LM融合)从FP16到INT4可获得3.4×加速,实时因子(RTF)为0.06。在NIST Hub5 2000、Hub5 2001和RT-03测试集上,我们保留了LM融合相关的绝大部分增益,将平均词错率(WER)改善>1.5%。
引用
@article{arxiv.2206.07882,
title = {Accelerating Inference and Language Model Fusion of Recurrent Neural Network Transducers via End-to-End 4-bit Quantization},
author = {Andrea Fasoli and Chia-Yu Chen and Mauricio Serrano and Swagath Venkataramani and George Saon and Xiaodong Cui and Brian Kingsbury and Kailash Gopalakrishnan},
journal= {arXiv preprint arXiv:2206.07882},
year = {2022}
}
备注
5 pages, 2 figures, 1 table. Paper accepted to Interspeech 2022