中文

面向高效语音识别的纯整数零样本量化

音频与语音处理 2022-02-01 v3 计算与语言 声音

摘要

端到端神经网络模型在各种自动语音识别(ASR)任务上取得了更好的性能。然而,由于内存和计算需求大,这些模型在边缘硬件上表现不佳。虽然将模型权重和/或激活量化为低精度可能是一种有前景的解决方案,但以往关于 ASR 模型量化的研究有限。特别是,以往方法在推理期间使用浮点运算,因此无法充分利用高效的整数处理单元。此外,它们在量化过程中需要训练和/或验证数据,而出于安全或隐私考虑这些数据可能不可用。为应对这些局限,我们提出了一种面向 ASR 模型的纯整数、零样本量化方案。具体而言,我们生成运行时统计特性与真实数据相似的合成数据,并用其在量化过程中校准模型。我们将该方法应用于量化 QuartzNet、Jasper 和 Conformer,并显示出与全精度基线模型相比可忽略的 WER 退化,即使不使用任何数据也是如此。此外,我们在 T4 GPU 上实现了高达 2.35 倍的加速和 4 倍的压缩率,在 INT8 量化下仅有 <1% 的轻微 WER 退化。

关键词

引用

@article{arxiv.2103.16827,
  title  = {Integer-only Zero-shot Quantization for Efficient Speech Recognition},
  author = {Sehoon Kim and Amir Gholami and Zhewei Yao and Nicholas Lee and Patrick Wang and Aniruddha Nrusimha and Bohan Zhai and Tianren Gao and Michael W. Mahoney and Kurt Keutzer},
  journal= {arXiv preprint arXiv:2103.16827},
  year   = {2022}
}