中文

用于语音识别的具备原生量化感知训练的 4-bit Conformer

音频与语音处理 2023-03-06 v4 机器学习

摘要

降低延迟与模型规模一直是实时自动语音识别(ASR)应用场景中的重要研究问题。在此方向上,模型量化已成为压缩神经网络与降低计算成本的日益流行的方法。现有多数实用 ASR 系统采用训练后 8-bit 量化。为在不引入额外性能退化的前提下实现更高压缩率,本研究提出开发具备原生量化感知训练的 4-bit ASR 模型,其利用原生整数运算有效优化训练与推理。我们在最先进的基于 Conformer 的 ASR 模型上进行了两组实验以评估所提量化技术。首先,我们探究了 LibriSpeech 数据集上权重与激活量化的不同精度的影响,获得了相比 float32 模型尺寸缩减 5.8 倍的无损 4-bit Conformer 模型。随后,我们首次研究并揭示了在大规模数据集训练的实用 ASR 系统上 4-bit 量化的可行性,并产出了混合 4-bit 与 8-bit 权重的无损 Conformer ASR 模型,相比 float32 模型尺寸缩减 5 倍。

关键词

引用

@article{arxiv.2203.15952,
  title  = {4-bit Conformer with Native Quantization Aware Training for Speech Recognition},
  author = {Shaojin Ding and Phoenix Meadowlark and Yanzhang He and Lukasz Lew and Shivani Agrawal and Oleg Rybakov},
  journal= {arXiv preprint arXiv:2203.15952},
  year   = {2023}
}

备注

Published at INTERSPEECH 2022