中文

面向具备设备端语音识别的 8 位神经网络加速器的亚 8 位量化感知训练

音频与语音处理 2022-07-01 v1 人工智能 信号处理

摘要

我们提出了一种用于 8 位神经网络加速器的新型亚 8 位量化感知训练(S8BQAT)方案。我们的方法受 Lloyd-Max 压缩理论启发,并做了实际适配以在训练期间实现可行的计算开销。利用从 32 位基线导出的量化质心,我们用多区域绝对余弦(MRACos)正则化项扩充训练损失,该正则化项将权重聚向其最近质心,有效地充当伪压缩器。此外,引入了周期性调用的硬压缩器,通过模拟运行时模型权重量化来提高收敛速度。我们使用循环神经网络转导器(RNN-T)架构将 S8BQAT 应用于语音识别任务。借助 S8BQAT,我们能够增大模型参数量以相对降低 4-16% 的词错误率,同时仍将延迟改善 5%。

关键词

引用

@article{arxiv.2206.15408,
  title  = {Sub-8-Bit Quantization Aware Training for 8-Bit Neural Network Accelerator with On-Device Speech Recognition},
  author = {Kai Zhen and Hieu Duy Nguyen and Raviteja Chinta and Nathan Susanj and Athanasios Mouchtaris and Tariq Afzal and Ariya Rastrow},
  journal= {arXiv preprint arXiv:2206.15408},
  year   = {2022}
}

备注

Accepted for publication in INTERSPEECH 2022