用于单通道语音增强的脉冲结构化状态空间模型
声音
2024-04-23 v2 计算机视觉与模式识别
音频与语音处理
摘要
语音增强旨在从含噪信号中提取干净语音。传统深度学习方法面临两个挑战:高效利用长语音序列中的信息,以及高计算成本。为应对这些,我们引入脉冲结构化状态空间模型(Spiking-S4)。该方法将脉冲神经网络(Spiking Neural Networks, SNN)的能效与结构化状态空间模型(Structured State Space Models, S4)的长程序列建模能力相融合,提供了一种引人注目的解决方案。在 DNS Challenge 与 VoiceBank+Demand 数据集上的评估证实,Spiking-S4 以更少计算资源媲美现有人工神经网络(Artificial Neural Network, ANN)方法,这由参数量与浮点运算次数(Floating Point Operations, FLOPs)的降低所佐证。
引用
@article{arxiv.2309.03641,
title = {Spiking Structured State Space Model for Monaural Speech Enhancement},
author = {Yu Du and Xu Liu and Yansong Chua},
journal= {arXiv preprint arXiv:2309.03641},
year = {2024}
}