中文

面向端侧语音识别的亚8位量化:一种无正则化方法

声音 2022-11-02 v2 机器学习 音频与语音处理

摘要

对于端侧自动语音识别(ASR),量化感知训练(QAT)在实现模型预测性能与效率的权衡方面无处不在。在现有QAT方法中,一个主要缺陷是量化质心必须预先确定并固定。为克服该限制,我们引入了一种在mu-Law约束空间内具有自调节质心、无正则化的“软到硬”压缩机制,从而形成了一种更简洁且更通用的量化方案,称为通用量化器(GQ)。我们将GQ应用于基于Recurrent Neural Network Transducer(RNN-T)和Conformer架构在LibriSpeech与去标识远场数据集上的ASR任务。在不损失精度的情况下,GQ可将RNN-T与Conformer均压缩至亚8位,且对于某些RNN-T层可压缩至1位以实现快速且准确的推理。通过物理设备基准测试,我们观察到相比8位QAT节省了30.73%的内存占用并降低了31.75%的用户感知延迟。

关键词

引用

@article{arxiv.2210.09188,
  title  = {Sub-8-bit quantization for on-device speech recognition: a regularization-free approach},
  author = {Kai Zhen and Martin Radfar and Hieu Duy Nguyen and Grant P. Strimel and Nathan Susanj and Athanasios Mouchtaris},
  journal= {arXiv preprint arXiv:2210.09188},
  year   = {2022}
}

备注

Accepted for publication at IEEE SLT'22