用于语音识别的 Transformer 语言模型混合精度量化
计算与语言
2021-12-23 v1 声音
音频与语音处理
摘要
以 Transformer 为代表的最先进神经语言模型正变得日益复杂,在实际应用中成本高昂。低比特深度神经网络量化技术为大幅缩减其模型规模提供了有力方案。当前低比特量化方法基于统一精度,未能考虑系统不同部分对量化误差的性能敏感度差异。为此,本文提出新颖的混合精度 DNN 量化方法。采用两种技术自动学习最优的局部精度设置。第一种基于以 Hessian 迹加权的量化扰动形式的量化敏感度度量。第二种基于混合精度 Transformer 架构搜索。使用交替方向乘子法(ADMM)高效训练混合精度量化 DNN 系统。在 Penn Treebank (PTB) 和 Switchboard 语料上训练的 LF-MMI TDNN 系统上进行的实验表明,所提出的混合精度 Transformer 量化技术相较全精度基线实现了高达 16 倍的模型规模压缩比,且识别性能无下降。当用于压缩层数更多的更大规模全精度 Transformer LM 时,获得了高达 1.7% 绝对(18% 相对)的整体词错误率(WER)降低。
引用
@article{arxiv.2112.11540,
title = {Mixed Precision of Quantization of Transformer Language Models for Speech Recognition},
author = {Junhao Xu and Shoukang Hu and Jianwei Yu and Xunying Liu and Helen Meng},
journal= {arXiv preprint arXiv:2112.11540},
year = {2021}
}
备注
arXiv admin note: substantial text overlap with arXiv:2112.11438, arXiv:2111.14479