中文

用于端侧关键词唤醒的定点量化感知训练

音频与语音处理 2023-03-08 v1 人工智能 机器学习 信号处理

摘要

定点(FXP)推理已被证明适用于计算资源有限的嵌入式设备,而模型训练却持续以浮点(FLP)进行。FXP 训练尚未被充分探索,且从 FLP 到 FXP 的非平凡转换带来不可避免的性降。我们提出一种训练并获得 FXP 卷积关键词唤醒(KWS)模型的新方法。我们将方法与两种量化感知训练(QAT)技术——压缩权重分布与针对模型参数的绝对余弦正则化——相结合,并提出将 QAT 扩展到瞬态变量的技术,而这是先前范式所忽略的。在 Google Speech Commands v2 数据集上的实验结果表明,我们能将模型精度降至 4-bit 且不损失准确率。此外,在一个内部 KWS 数据集上,我们显示在固定误拒率下,我们的 8-bit FXP-QAT 模型相对误发现率比较全精度 FLP 模型改善 4-6%。在推理时我们认为 FXP-QAT 消除了 q-format 归一化,并启用低比特累加器,同时最大化 SIMD 吞吐以减少用户感知延迟。我们证明可在不损害 KWS 模型预测性能或无需模型架构改动的情况下将执行时间减少 68%。我们的工作提供了有助于该领域未来研究的全新发现,并赋能准确且高效的模型。

关键词

引用

@article{arxiv.2303.02284,
  title  = {Fixed-point quantization aware training for on-device keyword-spotting},
  author = {Sashank Macha and Om Oza and Alex Escott and Francesco Caliva and Robbie Armitano and Santosh Kumar Cheekatmalla and Sree Hari Krishnan Parthasarathi and Yuzong Liu},
  journal= {arXiv preprint arXiv:2303.02284},
  year   = {2023}
}

备注

5 pages, 3 figures, 4 tables