HPCNeuroNet:以Transformer增强的脉冲神经网络推进神经形态音频信号处理
音频与语音处理
2023-11-22 v1 声音
摘要
本文提出一种新颖的神经形态音频处理方法,将脉冲神经网络(SNNs)、Transformers与高性能计算(HPC)的优势集成到HPCNeuroNet架构中。利用Intel N-DNS数据集,我们展示了系统处理跨多种语言与噪声背景的多样化人声录音的能力。我们方法的核心在于融合SNNs的时间动态与Transformers的注意力机制,使模型能捕捉复杂的音频模式与关系。我们的架构HPCNeuroNet采用短时傅里叶变换(STFT)进行时频表示,Transformer嵌入用于稠密向量生成,以及SNN编码/解码机制用于脉冲序列转换。系统的性能进一步通过利用NVIDIA GeForce RTX 3060 GPU与Intel Core i9 12900H CPU的计算能力得到增强。此外,我们在Xilinx VU37P HBM FPGA平台上实现了硬件部署,针对能效与实时处理进行优化。所提出的加速器在100 MHz下达到71.11 Giga-Operations Per Second(GOP/s)的吞吐量与3.55 W的片上功耗。与现成设备及近期最先进实现的对比结果表明,该加速器在能效与设计灵活性方面具有明显优势。通过设计空间探索,我们提供了优化音频任务核心容量的见解。我们的发现凸显了集成SNNs、Transformers与HPC用于神经形态音频处理的变革潜力,为未来研究与应用确立了新基准。
引用
@article{arxiv.2311.12449,
title = {HPCNeuroNet: Advancing Neuromorphic Audio Signal Processing with Transformer-Enhanced Spiking Neural Networks},
author = {Murat Isik and Hiruna Vishwamith and Kayode Inadagbo and I. Can Dikmen},
journal= {arXiv preprint arXiv:2311.12449},
year = {2023}
}
备注
Submitted to IEEE Transactions on Signal Processing