一种用于语音分离的 1.6-mW 稀疏深度学习加速器
声音
2023-12-18 v1 硬件体系结构
音频与语音处理
摘要
语音处理中的低功耗深度学习加速器使得边缘设备上的实时应用成为可能。然而,现有的加速器大多存在功耗高的问题,且仅专注于图像应用。本文通过算法和硬件优化,提出了一种用于语音分离的低功耗加速器。在算法层面,通过结构化敏感度以及非结构化剪枝对模型进行压缩,并进一步量化为移位的 8 位浮点格式,而非 32 位浮点格式。通过分解空洞卷积和转置卷积,跳过了具有零核和零激活值的计算。在硬件层面,压缩后的模型由具有八个独立乘加器(MACs)的架构以及简单的跳零硬件提供支持,以利用激活稀疏性和低功耗处理。所提出的方法将模型尺寸减小了 95.44\%,计算复杂度降低了 93.88\%。采用 TSMC 40 工艺的最终实现能够实现实时语音分离,在 150 MHz 下运行时功耗为 1.6 mW。归一化的能效和面积效率分别为 2.344 TOPS/W 和 14.42 GOPS/mm。
引用
@article{arxiv.2312.09580,
title = {A 1.6-mW Sparse Deep Learning Accelerator for Speech Separation},
author = {Chih-Chyau Yang and Tian-Sheuan Chang},
journal= {arXiv preprint arXiv:2312.09580},
year = {2023}
}