基于 LSTM 的语音识别模型的 4-bit 量化
计算与语言
2021-08-30 v1 机器学习
声音
音频与语音处理
摘要
我们研究了在两类大型基于 LSTM 的自动语音识别(ASR)架构中,权重与激活的激进低精度表示的影响:混合深度双向 LSTM - 隐马尔可夫模型(DBLSTM-HMMs)与循环神经网络 - 转导器(RNN-Ts)。使用 4-bit 整数表示时,直接应用于这些模型 LSTM 部分的朴素量化方法会导致词错误率(WER)显著下降。另一方面,我们表明,通过恰当选择量化器与初始化,可实现最小的精度损失。特别地,我们根据网络的局部特性定制量化方案,在限制计算时间的同时改善识别性能。我们在 NIST Hub5-2000 评测的 Switchboard (SWB) 与 CallHome (CH) 测试集上验证了我们的方案。使用 300 或 2000 小时 SWB 数据训练的 DBLSTM-HMMs 分别实现了 与 的平均 WER 下降。在更具挑战性的 RNN-T 模型上,我们的量化策略将 4-bit 推理的下降限制在 1.3%。
引用
@article{arxiv.2108.12074,
title = {4-bit Quantization of LSTM-based Speech Recognition Models},
author = {Andrea Fasoli and Chia-Yu Chen and Mauricio Serrano and Xiao Sun and Naigang Wang and Swagath Venkataramani and George Saon and Xiaodong Cui and Brian Kingsbury and Wei Zhang and Zoltán Tüske and Kailash Gopalakrishnan},
journal= {arXiv preprint arXiv:2108.12074},
year = {2021}
}
备注
5 pages, 3 figures, Andrea Fasoli and Chia-Yu Chen equally contributed to this work. Paper accepted to Interspeech 2021