基于混合FP16-INT8训练后量化的多核MCU上RNN语音增强加速
声音
2022-10-17 v1 机器学习
系统与控制
音频与语音处理
系统与控制
摘要
本文提出了一种优化方法,用于在具有1+8个通用RISC-V核的先进微控制器单元(MCU)上设计并部署基于循环神经网络(RNN)的语音增强(SE)算法。为实现低延迟执行,我们提出了一种优化的软件流水线,将LSTM或GRU循环块的并行计算(具有向量化的8位整数(INT8)和16位浮点(FP16)计算单元)与手动管理的模型参数内存传输交错进行。为确保相对于全精度模型的最小精度下降,我们提出了一种新颖的FP16-INT8混合精度训练后量化(PTQ)方案,将循环层压缩为8位,而其余层的位精度保持为FP16。实验在Valentini数据集上训练的多个基于LSTM和GRU的SE模型上进行,参数规模高达1.24M。得益于所提出的方法,相对于无损FP16基线,我们将计算速度提升了高达4倍。与均匀8位量化使PESQ分数平均下降0.3不同,混合精度PTQ方案仅导致0.06的低下降,同时实现了1.4-1.7倍的内存节省。得益于该压缩,我们将大型模型适配于有限的片上非易失性内存,从而削减了外部内存的功耗,并通过将电源电压从0.8V降至0.65V同时仍满足实时约束,实现了高达2.5倍的MCU功耗节省。我们的设计比部署在单核MCU上、使用较小模型和量化感知训练的最先进SE方案节能10倍。
引用
@article{arxiv.2210.07692,
title = {Accelerating RNN-based Speech Enhancement on a Multi-Core MCU with Mixed FP16-INT8 Post-Training Quantization},
author = {Manuele Rusci and Marco Fariselli and Martin Croome and Francesco Paci and Eric Flamand},
journal= {arXiv preprint arXiv:2210.07692},
year = {2022}
}
备注
Accepted at the ITEM Workshop 2022 (located at ECML-PKDD2022)