面向超低功耗神经形态语音增强的Spiking-FullSubNet
音频与语音处理
2024-10-08 v1 声音
摘要
语音增强对于提高各种音频设备中语音的清晰度和质量至关重要。近年来,基于深度学习的方法显著提升了语音增强性能,但这些方法通常伴随着高昂的计算成本,这对于大量边缘设备(如耳机和助听器)而言是难以承受的。本文提出了一种基于脑启发脉冲神经网络(SNN)的超低功耗语音增强系统,称为Spiking-FullSubNet。Spiking-FullSubNet采用全频带和子频带融合的方法,以有效捕获全局和局部频谱信息。为了提高计算成本高昂的子带建模效率,我们引入了一种受人类外周听觉系统敏感度曲线启发的频率划分方法。此外,我们提出了一种新型脉冲神经元模型,该模型能够动态控制输入信息的整合与遗忘,增强了SNN的多尺度时间处理能力,这对语音去噪至关重要。在最近的英特尔神经形态深度噪声抑制(N-DNS)挑战赛数据集上进行的实验表明,Spiking-FullSubNet在语音质量和能效指标上均大幅超越了现有最先进方法。值得注意的是,我们的系统赢得了英特尔N-DNS挑战赛(算法赛道)的冠军,为边缘端的超低功耗语音增强开辟了众多可能性。我们的源代码和模型检查点已在 https://github.com/haoxiangsnr/spiking-fullsubnet 公开。
引用
@article{arxiv.2410.04785,
title = {Towards Ultra-Low-Power Neuromorphic Speech Enhancement with Spiking-FullSubNet},
author = {Xiang Hao and Chenxiang Ma and Qu Yang and Jibin Wu and Kay Chen Tan},
journal= {arXiv preprint arXiv:2410.04785},
year = {2024}
}
备注
under review